通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化

2026年9月21日 09:19
通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化
站內 AI 整理稿

AI資訊AI新聞資訊正文通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化發佈於AI新聞資訊發佈時間 :2026年9月21號 9:10閱讀 :1分鐘9月21日,通義千問團隊正式開源新一代圖像模型 Qwen-Image-2.1。該模型以僅7B 參數的輕量視覺生成模塊,將文生圖、透明圖像生成與多種圖像編輯能力整合於同一框架,在生成效果、推理效率與使用成本之間取得了新的平衡。據官方介紹,Qwen-Image-2.1的視覺生成部分採用32層 Single-Stream DiT 結構,參數量僅為7B。

通過混合粒度注意力結構與 KV Cache 複用機制,模型在多圖輸入場景下的推理效率顯著提升,顯存開銷也得到有效控制。透明圖像生成是本次更新的核心亮點之一。模型能夠根據提示詞自動判斷輸出普通圖像或帶透明通道的 RGBA 圖像,並支持在保留透明背景的前提下進行主體表情修改、文字編輯等操作。用戶還可輸入真實照片,由模型自動提取主體並輸出透明圖層,方便後續設計與合成。可以在保留透明背景的同時修改主體表情透明圖層中的文字同樣可以進行編輯,如下面的示例將文字“BLOOM”修改為“Qwen-Image”:在圖像編輯方面,Qwen-Image-2.

1支持最多10張參考圖輸入,可綜合多個主體與素材生成協調畫面。局部編輯支持圈選、塗抹和獨立掩碼三種方式,編輯區域指定更加靈活。模型還重點提升了人像與商品的一致性——修圖後人物面部特徵、商品文字與形態均能保持高度還原。此外,模型在文字渲染、人物光影與細節刻畫上也有明顯提升,覆蓋全景圖、信息圖、分鏡圖等多種任務場景。目前,Qwen-Image-2.1已同步在 GitHub、ModelScope 和 Hugging Face 等平臺開源,供開發者與創作者免費使用。相關推薦通義千問官方點贊!Unsloth Dynamic V3 讓 Qwen3.

8-27B 更小更聰明,1-bit 版 8GB 內存就能跑通義千問官方公開致謝 Unsloth 團隊,高度認可其發佈的 Qwen3.8-27B GGUF 量化版本,稱其“更小更聰明”。此舉在開源社區引發熱議,凸顯本地大模型部署門檻持續降低,官方鼓勵用戶嘗試該版本。2026年8月20號 15:57301.7k顛覆認知!擺脫獨立顯卡束縛,阿里5nm RISC-V芯片成功原生跑通270億大模型阿里達摩院旗艦CPU玄鐵C950實現里程碑:原生運行通義千問3.8-27B大模型,成為RISC-V架構首次不依賴GPU、無需模擬層直接驅動270億參數大模型。

該64位服務器級處理器採用臺積電5nm工藝,集成64個計算核心,展現技術潛力。2026年8月19號 10:42351.3k前通義千問負責人林俊暘官宣創業 Pragmatik Labs獲數億美元融資估值達20億前阿里通義千問負責人林俊暘在滬創立AI實驗室“Pragmatik Labs”(語用科技),專注研發貫通數字與物理世界的通用智能體,提出“Agents for digital and physical worlds”核心理念。首輪融資獲高榕創投與紅杉中國聯合注資。2026年8月12號 16:00221.

2k通義千問開放平臺上線 “對話即服務”打通生活場景全鏈路通義千問開放平臺上線,支持手機、PC、AI眼鏡三端,用戶無需跳轉APP,通過對話即可使用物流、租房、家政、理財等十餘領域服務。例如@順豐速運查寄件、@自如根據條件匹配房源並VR看房、@天鵝到家預約保潔核對合同、@盈米基金提供理財分析,彩雲天氣也可推薦信息。2026年8月10號 11:34234.3k阿里千問大模型重磅更新:Qwen3.8-MAX加持,打造“真·辦公助理”新範式 正文:通義千問大模型升級,新增“思考研究”“定時任務”“辦公助理”三大能力,全面支持旗艦模型Qwen3.8-MAX。

此次升級推動大模型從輔助對話向自主執行轉型,聚焦複雜決策與重複性工作痛點。其中“思考研究”模式經深度優化,助力職場效率提升。2026年8月7號 10:33536.0k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽

目前該功能已面向管理員開放測試,但需通過設備管理系統啟用BrowsingEnabled策略,更廣泛的自動推廣預計將在11月底進行。微軟表示,9月21日還將發佈補充更新,為側邊欄網頁標籤增加右鍵菜單,可直接選擇在外部瀏覽器中打開鏈接。此前用戶點擊Copilot回答中的參考鏈接通常需要跳轉至外部瀏覽器,新功能則允許網頁直接加載在Copilot內部,關閉頁面後即可繼續對話。

剛剛

我國首款藏語多語言全模態 AI 輸入法發佈:覆蓋手機電腦,支持三大方言語音輸入

該輸入法由藏語智能全國重點實驗室研發,依託實驗室自主知識產權的大模型及相關 AI 基礎設施,覆蓋手機、電腦等全終端,支持文字、語音、圖像等多模態輸入,並可通過統一賬號同步詞庫和輸入習慣。三地方言語音、藏漢英混合 OCR青海師範大學教授、藏語智能全國重點實驗室常務副主任多拉表示,智達 AI 輸入法以智達大模型作為核心技術底座開發而成。

剛剛

TypeSafe AI 推出決策專用模型 Jev:比大語言模型快 10 倍、成本僅十分之一

與傳統大語言模型不同,Jev 專門用於回答是 / 否問題以及多項選擇題,並給出置信度評分。公司稱,軟件開發過程中大量工作本質是一系列決策,而 Jev 在這類任務上比大語言模型快10倍、成本僅為其十分之一。據 TypeSafe AI 介紹,Jev 不生成文本,而是直接輸出結構化決策結果,供程序直接使用。

剛剛

Gemini Notebook迎返校更新:講座錄音、AI複習和60秒視頻一站完成

錄音功能已在Gemini Notebook iOS和Android應用上線,可錄製講座或想法,並自動生成轉錄內容,與用戶上傳的參考資料集中保存。學習功能方面,互動式學習概覽可將原始資料整理為複習指南,並提供Studio輸出、摘要、思維導圖、測驗和記憶卡片;“短視頻概覽”則通過教育動畫和語音講解,在60秒內解釋公式及複雜概念,支持80多種語言並可分享。

剛剛