阿里最新圖像模型開源!視覺生成部分僅7B,能生透明圖、能改圖

2026年9月21日 02:09
站內 AI 整理稿

作者 | 楊京麗 編輯 | 李水青 9月21日,昨晚,千問開源圖像模型Qwen-Image-2.1。該模型將文生圖與圖像編輯整合在同一模型中,視覺生成部分僅包含7B參數,並原生支持透明圖像生成與編輯。從實際功能來看,模型通過輕量結構與推理優化,在保證生成質量的同時,保持較低的計算成本。模型最多支持10張參考圖輸入,可用於多主體合成和多種局部編輯,並儘量保持人物和商品的原有特徵。此外,模型還調整了文字排版、人物光影和圖像細節,讓生成結果更貼近實際設計需求。官方公佈的Qwen-Image-Bench評測顯示,該模型以7B視覺生成模塊取得60.

28分,位列開源模型第一,超過Nano Banana 2.0、GPT Image 1.5等閉源模型,落後於GPT Image 2、Grok Imagine 2.0等模型。▲Qwen-Image-Bench公開評測對比(圖源:千問大模型) 這次開源距離Qwen-Image系列上一次開源已過去約9個月,上一次是去年12月開源的Qwen-Image-2512。在閉源的Qwen-Image線上,千問圖像模型已於今年7月更新至Qwen-Image-3.0版本。開源地址: GitHub: https://github.com/QwenLM/Qwen-Image-2.

1 Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1 Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1 一、視覺生成部分僅7B參數,領先Nano Banana 2.0、GPT Image 1.5等 Qwen-Image-2.1參數規模較小,視覺生成部分包含32層Single-Stream DiT(單流擴散Transformer)架構,參數量為7B。在較小的模型規模下,Qwen-Image-2.1依然保持不錯的圖像生成質量。

在Qwen-Image-Bench公開評測中,它以7B參數的視覺生成模塊,取得了與閉源模型近似的水平,得分60.28,領先Nano Banana 2.0、GPT Image 1.5等模型。在推理結構上,模型優化推理效率,採用混合粒度注意力結構。模型對文本和圖像採用不同的處理策略:文本部分,系統前綴和編輯指令使用Token級因果掩碼;圖像生成部分使用Chunk級掩碼。同時,模型還使用KV Cache複用機制,將輸入圖像和編輯指令作為靜態上下文,在首步完成預計算並緩存,以提升推理效率、降低顯存開銷。▲Qwen-Image-2.

1混合粒度注意力結構(圖源:千問大模型) 二、支持透明圖像生成,生成和編輯在同一模型完成 透明圖像是Qwen-Image-2.1此次更新的重點能力之一。模型可以根據提示詞自動判斷輸出普通圖像或帶透明通道的圖像,可以生成單個主體,也能生成由多個元素組成的複雜透明素材。在編輯場景中,用戶可以保持透明背景不變,只修改主體的表情、顏色或其他局部細節。透明圖層中的文字也能被直接替換,例如將圖層中的“BLOOM”修改為“Qwen-Image”。在修改文字的同時,其他部分基本沒有發生變化,文字也能根據實際情況調整大小。對於真實照片,Qwen-Image-2.

1可以從RGB圖像中提取指定主體,並輸出帶透明通道的RGBA圖層,方便後續用於平面設計、商品合成和內容製作。模型可以提取出照片的前景樹葉,形成透明的素材,刪除背景中的建築物等內容。三、最多輸入10張參考圖,覆蓋多種編輯任務 Qwen-Image-2.1最多支持10張參考圖輸入,具備多種局部編輯方式、人像與商品一致性增強,並覆蓋多種類型編輯任務。在多人合照場景中,模型能夠將多張人物照片整合到同一畫面。輸入六個人物照片後,模型可以將他們整合成一張合照,調整人物姿勢、畫面光影等細節,讓整個畫面保持自然。在服裝搭配場景中,用戶可以輸入模特、衣服、鞋子、包包和帽子等圖片,生成完整的穿搭效果。

成圖以街拍畫面為基礎,將粉色短款外套、黑白毛絨帽、棕色包和銀色鞋子自然融入模特的整體穿搭中。在室內設計場景中,模型參考10張家居圖片,完成整體空間佈置。模型參考了走廊、沙發、餐桌、單椅、時鐘、地毯、綠植等多張家居圖片,將不同傢俱和裝飾元素整合到同一間客廳中。局部編輯方面,模型支持圈選、塗抹和獨立掩碼三種方式。用戶可以在圖像中圈出多個區域,並分別提出修改要求。下面這個例子中,要求模型“去掉藍色圈的金屬手錶,把紅色圈的頭髮顏色改為黑色,把綠色圈替換為灰色短袖亞麻睡衣”,模型能夠精準對這三個區域進行修改編輯。模型還支持塗抹指定位置修改。

這個案例中,在原圖鯊魚右側進行了白色塗抹,模型在這塊白色區域添加了一名潛水員。如果希望儘可能保留原圖內容,用戶還可以將原圖和獨立掩碼作為兩張圖片輸入,由掩碼明確指定需要修改的區域。輸入原圖後,把需要添加的馬仔人物以掩碼的形式輸入,模型可以結合這兩張圖片輸入,形成一張人物騎在馬背上的圖片。四、人像和商品保真度提升,文字與畫面質感同步增強 千問稱,Qwen-Image-2.1增強了人像編輯中的面部細節還原能力,能夠在修圖前後保持人物特徵的高度一致。模型可以根據一張自拍,生成人物在竹林中的全身照,並修改人物服飾。進行多次調整後,人物的面部細節,仍與輸入圖像人物特徵基本一致。

在商品編輯中,模型重點保持商品的文字、紋理和外形,使商品置於新場景後仍能保留原有特徵。這類能力可用於電商展示、廣告素材製作和商品視覺設計。從官方案例來看,輸入手串商品圖後,模型基本保留了手串的整體結構、配色和材質,並將其放置到人物佩戴的場景中。不過,成圖中的黑色珠子尺寸略大,與原圖相比仍存在細微差異。模型還覆蓋全景圖、信息圖和分鏡圖生成等任務。例如,輸入一張自拍照後,模型可以將其擴展為全景。在可視化工具中,用戶可以從不同視角查看場景,天空、雲層、樹木、街道等細節基本符合物理規律。輸入模特照片後,模型可以生成內容豐富的複雜信息圖,展示人物檔案、配飾細節、服飾細節、風格關鍵詞等信息。

模型還可以根據人物三視圖,生成完整分鏡,為故事創作和視覺敘事提供素材。在圖像質感方面,Qwen-Image-2.1進一步優化了文字生成、字體選擇和版式佈局。模型能夠生成包含大量圖片、文字、圖表等多種信息的論文界面。成圖中文字清晰,內容未出現明顯錯亂,整體排版較為合理,頁面結構也保持美觀。在人物表現上,Qwen-Image-2.1增強了光影與細節表現,使畫面更接近真實攝影和商業設計效果。結語:統一生成與編輯,進一步降低圖像創作門檻 Qwen-Image-2.1在7B視覺生成模塊的基礎上,把透明圖像生成、透明圖層編輯、多圖輸入和局部修改能力放進同一套模型,進一步降低圖像創作門檻。

對於設計、電商和內容製作場景,透明圖像和多圖編輯可以減少摳圖、合成及反覆修改的步驟。模型最終能否在本地部署成本、生成速度和複雜編輯效果之間取得平衡,還需要結合實際體驗和開源社區反饋進一步觀察。

Related

相關文章

鈦媒體生成式AI

Anew labs,“蒸餾”的行家

醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

剛剛

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上

Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。

剛剛

Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放

針對開發者的實際工作流,桌面端提供內置終端、瀏覽器和 Git 狀態查看等功能,支持直接運行和調試項目、審閱代碼改動,並可關聯 PR 狀態,方便跟蹤代碼評審與合併進度。相關推薦法國興業銀行押注 AI:預計最多省下 6 億歐元成本法國興業銀行稱,AI應用擴大將帶來可觀降本空間,潛在規模約5億至6億歐元,其中已規劃到2029年實現約3.

剛剛

法國興業銀行押注 AI:預計最多省下 6 億歐元成本

這家總部位於巴黎的銀行表示,藉助 AI 實現降本的當前潛在空間介於 5 億至 6 億歐元(約合 38.47 億至 46.16 億元人民幣)之間。其中,到 2029 年為止已經落實規劃的降本規模約為 3.5 億歐元(約合 26.93 億元人民幣)。

剛剛