阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭
AI資訊AI新閒資訊正文阿里 70 億參數圖像模型Qwen-Image-2.1 開源發佈,號稱以瘦身之軀叫板閉源巨頭發布於AI新閒資訊時間 :Sep 21, 2026閱讀 :1分鐘阿里通義千問團隊近日端出了一道讓開源社區眼前一亮的菜:開放權重的圖像生成與編輯模型Qwen-Image-2.1正式登場。最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。Qwen-Image-2.
1最拿手的一招是"合併同類項"。官方展示的合照裡,每張面孔都來自不同人物的單獨照片,模型像一位耐心的拼圖師,把它們自然縫合成一張群像。這背後是它對透明圖像的原生支持——生成的不是普通RGB圖,而是帶透明通道的RGBA格式,用戶於是可以把物體單獨摳出來,也能直接在透明圖層上改寫文字,排版和後期都省了事。參考圖的處理能力同樣誇張。一次最多吞下十張參考圖,群像合成、虛擬試穿、房間設計都在這套框架裡跑通。想局部修改也不必重畫整張圖,畫個圈、塗個遮罩、隨手點幾下做標記,模型就明白該動哪一塊。團隊透露,架構層面的改動加上KV緩存複用,讓推理速度明顯提升,尤其當參考圖數量一多,提速感受更明顯。
門檻也放得很低。模型已在Hugging Face、GitHub和魔搭社區(ModelScope)同步上線,還配了個在線Demo供人把玩。唯一需要注意的是授權:它掛的是研究許可,明確禁止商用,企業用戶若想落地,得另外向千問團隊單獨申請商業授權。換句話說,個人把玩與學術探索敞開大門,真要賺錢做生意,還得先過授權這一關。相關推薦通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化9月21日,通義千問團隊開源新一代圖像模型Qwen-Image-2.1。該模型以僅7B參數的輕量視覺生成模塊,統一文生圖、透明圖像生成與多種圖像編輯能力,實現生成效果、推理效率與使用成本的新平衡。
其視覺生成採用32層Single-Stream DiT結構,藉助混合粒度注意力與KV Cache複用機制,優化多圖輸入場景下的效率與表現。Sep 21, 2026144.2k阿里通義千問發佈 Qwen-Image-3.0-Pro:文生圖 Arena 中國第一,10px 級文字渲染單張 4 美分起通義千問發佈Qwen-Image-3.0 Pro與Standard模型,在Arena文生圖榜單位居中國模型第一、主流第二。支持4.5k-token長提示、10px級精細文字渲染及12種語言,Pro版起價0.04美元/張。核心亮點是首次將生成與編輯融合進單一架構,實現多能力統一。
Aug 5, 2026585.5k微軟自研雙模型MAI-Image-2.5-Pro與MAI-Voice-2-Flash發佈:不蒸餾第三方,已落地Bing和PowerPoint微軟發佈兩款自研AI模型:高精度圖像模型MAI-Image-2.5-Pro,GPU成本最高降84%;語音模型MAI-Voice-2-Flash,專攻高併發交互。訓練數據清潔可追溯,不依賴第三方模型蒸餾,從設計之初即面向微軟產品用戶。Jul 24, 2026216.4k阿里發佈Qwen-Image-3.0,支持4.5K Token超長輸入與複雜圖文生成阿里發佈Qwen-Image-3.0圖像生成基礎模型,支持最長4.
5K Token文本輸入,可一次性生成公式、幾何圖形、邏輯推導及多層UI等複雜內容,原生兼容12種語言和20餘款字體渲染,文本長度較上代提升4.5倍,大幅強化影視分鏡、知識圖解等商業級圖文創作能力。Jul 21, 2026318.4k首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放阿里通義千問發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,實現從“能說話”到“會表達”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。
雙版本中Flash版主打低延遲實時交互(首包約300ms),Plus版專攻高質量自然度與音色還原。Jul 20, 2026309.2k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

AI能救電視臺嗎?
AI能救電視臺嗎?虛眸2026.09.21 13:39 · 來自北京全文3888字00:00 / 11:54不是彎道超車,是救命稻草。文 | 虛眸在AI的潮流面前,電視臺也不想被落下。 9月17日,《後西遊記》原班人馬製作的AIGC紀錄片《臺灣島紀》在湖南衛視、芒果TV播出,加上即將在國慶期間上線的《後西遊記》“戰天宮篇”,不到一個月時間裡,湖南廣電緊鑼密鼓發佈了三部AI長篇敘事的作品。嚐鮮AI內容的不止湖南衛視,包括江蘇、浙江、安徽、廣東等還保持著一定號召力的地方衛視,都將AI內容納入了電視臺供給庫中。這選擇不難理解,畢竟多數電視臺都錯過了移動互聯網的風口,而AI對內容製作的顛覆性,似乎比當年的互聯網還要大。大多數電視臺如今資金緊縮、內容供給短缺,需要作品填充7x24小時不斷供的時長,而AI“把影視劇的價格打了下來”,當然是必須抓住的機會。湖南衛視的《後西遊記》反響已經足夠強烈,但對於多數電視臺而言,這種模式是否具備參考和借鑑意義?答案可能並不如想象的樂觀。內容製作的競爭裡,落下一程,便是群山萬重,沒有彎道超車。地方電視臺的“內容荒” AI內容進入地方衛視,是誰在需要誰?就AI影視劇的處境、地方衛視的國有屬性而言,直觀的答案是,前者需要後者。 儘管AI內容此前已經在網播平臺驗證了自己的號召力,不論是紅果、抖音上的AI短劇、短片,還是愛奇藝、騰訊視頻播出的AI長片、中劇,都在實質層面獲得了大量觀眾接納,但是這種價值驗證停留在民間的市場化行為層面,進入電視臺,才是行業合法性、合規性的蓋章認可。它向行業傳達的信息是,AI影視尚在藍海階段,將得到潛在的政策紅利的長線扶持,這正是《後西遊記》在股市激起如此大反響的最重要原因之一。 然而,脫離宏觀的產業前景來看,就眼前而言,電視臺對AI內容的需求恐怕更為強烈、更緊迫。因為AI內容的主要播出渠道不是電視臺,上星、上黃金時段的需求是階段性

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭
最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

開源Top2!實測階躍Step 5 Preview,真有點猛啊…
。 昨天,階躍星辰毫無預兆地端出了最新一代旗艦基座模型——Step 5 Preview。 MoE架構,600B總參數、激活參數僅27B,1M上下文。 Agent能力大幅提升,在Artificial Analysis的最新評測中,Step 5 Preview取得44分,直接衝到全球開源Top 2。 要知道,其他拿到這一分數的大模型,大多都是萬億參數級別。

最火啞巴模型Jev加上微信,直接治好了我的低情商
字母AI2026.09.21 11:44 · 來自北京全文3770字00:00 / 10:28Jev微信插件爆火,根據對方消息直接揣測對方想法。文 | 字母AI谷歌的啞巴模型Jev突然爆火。它不聊天,不寫代碼,不寫文案,也不解釋,你問它什麼,它一個字都不生成。它只做一件事——判斷。發佈沒幾天,從Hacker News,再到中文技術社區,幾乎所有人都在討論它。但大家討論的不是它有多聰明,而是它有多反常。誠然,一個不會說話的模型能火,這事本身就已經夠反常的了。大家最先討論的,是它的落地場景。

快手把直播字幕延遲砍到 500 毫秒內:自研端到端工程範式,把電商直播的字幕打成"實時"
最直接的數字是:主播發聲到字幕具備展示條件的端到端延遲,從過去的1.5到2秒壓到了400到500毫秒,字符錯誤率(CER)從7.81% 降到3.51%,背後還要撐住千萬級的持續併發——這在以高併發、強實時著稱的電商直播場景裡,第一次有了一套成體系的工程打法。

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速
X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。