阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭

2026年9月21日 04:014700 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文阿里 70 億參數圖像模型Qwen-Image-2.1 開源發佈,號稱以瘦身之軀叫板閉源巨頭發布於AI新閒資訊時間 :Sep 21, 2026閱讀 :1分鐘阿里通義千問團隊近日端出了一道讓開源社區眼前一亮的菜:開放權重的圖像生成與編輯模型Qwen-Image-2.1正式登場。最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。Qwen-Image-2.

1最拿手的一招是"合併同類項"。官方展示的合照裡,每張面孔都來自不同人物的單獨照片,模型像一位耐心的拼圖師,把它們自然縫合成一張群像。這背後是它對透明圖像的原生支持——生成的不是普通RGB圖,而是帶透明通道的RGBA格式,用戶於是可以把物體單獨摳出來,也能直接在透明圖層上改寫文字,排版和後期都省了事。參考圖的處理能力同樣誇張。一次最多吞下十張參考圖,群像合成、虛擬試穿、房間設計都在這套框架裡跑通。想局部修改也不必重畫整張圖,畫個圈、塗個遮罩、隨手點幾下做標記,模型就明白該動哪一塊。團隊透露,架構層面的改動加上KV緩存複用,讓推理速度明顯提升,尤其當參考圖數量一多,提速感受更明顯。

門檻也放得很低。模型已在Hugging Face、GitHub和魔搭社區(ModelScope)同步上線,還配了個在線Demo供人把玩。唯一需要注意的是授權:它掛的是研究許可,明確禁止商用,企業用戶若想落地,得另外向千問團隊單獨申請商業授權。換句話說,個人把玩與學術探索敞開大門,真要賺錢做生意,還得先過授權這一關。相關推薦通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化9月21日,通義千問團隊開源新一代圖像模型Qwen-Image-2.1。該模型以僅7B參數的輕量視覺生成模塊,統一文生圖、透明圖像生成與多種圖像編輯能力,實現生成效果、推理效率與使用成本的新平衡。

其視覺生成採用32層Single-Stream DiT結構,藉助混合粒度注意力與KV Cache複用機制,優化多圖輸入場景下的效率與表現。Sep 21, 2026144.2k阿里通義千問發佈 Qwen-Image-3.0-Pro:文生圖 Arena 中國第一,10px 級文字渲染單張 4 美分起通義千問發佈Qwen-Image-3.0 Pro與Standard模型,在Arena文生圖榜單位居中國模型第一、主流第二。支持4.5k-token長提示、10px級精細文字渲染及12種語言,Pro版起價0.04美元/張。核心亮點是首次將生成與編輯融合進單一架構,實現多能力統一。

Aug 5, 2026585.5k微軟自研雙模型MAI-Image-2.5-Pro與MAI-Voice-2-Flash發佈:不蒸餾第三方,已落地Bing和PowerPoint微軟發佈兩款自研AI模型:高精度圖像模型MAI-Image-2.5-Pro,GPU成本最高降84%;語音模型MAI-Voice-2-Flash,專攻高併發交互。訓練數據清潔可追溯,不依賴第三方模型蒸餾,從設計之初即面向微軟產品用戶。Jul 24, 2026216.4k阿里發佈Qwen-Image-3.0,支持4.5K Token超長輸入與複雜圖文生成阿里發佈Qwen-Image-3.0圖像生成基礎模型,支持最長4.

5K Token文本輸入,可一次性生成公式、幾何圖形、邏輯推導及多層UI等複雜內容,原生兼容12種語言和20餘款字體渲染,文本長度較上代提升4.5倍,大幅強化影視分鏡、知識圖解等商業級圖文創作能力。Jul 21, 2026318.4k首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放阿里通義千問發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,實現從“能說話”到“會表達”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。

雙版本中Flash版主打低延遲實時交互(首包約300ms),Plus版專攻高質量自然度與音色還原。Jul 20, 2026309.2k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭

最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

剛剛
量子位生成式AI

開源Top2!實測階躍Step 5 Preview,真有點猛啊…

。 昨天,階躍星辰毫無預兆地端出了最新一代旗艦基座模型——Step 5 Preview。 MoE架構,600B總參數、激活參數僅27B,1M上下文。 Agent能力大幅提升,在Artificial Analysis的最新評測中,Step 5 Preview取得44分,直接衝到全球開源Top 2。 要知道,其他拿到這一分數的大模型,大多都是萬億參數級別。

剛剛
鈦媒體生成式AI

最火啞巴模型Jev加上微信,直接治好了我的低情商

字母AI2026.09.21 11:44 · 來自北京全文3770字00:00 / 10:28Jev微信插件爆火,根據對方消息直接揣測對方想法。文 | 字母AI谷歌的啞巴模型Jev突然爆火。它不聊天,不寫代碼,不寫文案,也不解釋,你問它什麼,它一個字都不生成。它只做一件事——判斷。發佈沒幾天,從Hacker News,再到中文技術社區,幾乎所有人都在討論它。但大家討論的不是它有多聰明,而是它有多反常。誠然,一個不會說話的模型能火,這事本身就已經夠反常的了。大家最先討論的,是它的落地場景。

剛剛

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速

X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。

剛剛