阿里千問發佈 Qwen-Image-3.0 圖像生成基礎模型:落字成畫,字字如印

重點摘要
首頁 > 智能時代>人工智能 阿里千問發佈 Qwen-Image-3.0 圖像生成基礎模型:落字成畫,字字如印 2026/7/21 14:56:42 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 烏蠅哥的左手 的線索投遞! IT之家 7 月 21 日消息,阿里發佈最新圖像生成基礎模型 Qwen-Image-3.0。新模型支持最大 4.
阿里於今日(7月21日)正式推出最新一代圖像生成基礎模型——Qwen-Image-3.0,這是千問(Qwen)系列在影像生成領域的第三代產品。此次發佈的核心亮點在於模型不再只是追求畫面美感,而是著重解決「實用性」難題,讓AI生成的圖像真正能承擔具體工作任務。Qwen-Image-3.0支援長達5,000個token的超長輸入,這項能力讓模型可以一次性處理並生成包含大量文字與複雜結構的圖像。例如,它能同時產出數學試卷、學術論文等需要公式符號、幾何圖形、邏輯推導步驟等多種元素融合的知識圖解,也能生成複雜的UI介面設計。
過去AI圖像生成模型往往在文字渲染上表現不佳,經常出現字體歪斜、字元錯亂或無法辨識的情況,而Qwen-Image-3.0特別強化了文字生成能力。在文字渲染方面,該模型支援12種語言的文字生成,並內建超過20款字體的原生渲染能力,能夠確保文字清晰、排版精準。這項突破大幅降低了多語言產品海報、影視分鏡、漫畫分鏡等「可讀可用」商業素材的生產成本。以往需要設計師手動調整文字排版或使用多種工具組合才能完成的工作,現在可以透過單一模型直接生成,且字字清晰,如同印刷一般。阿里千問團隊在官方介紹中指出,AI圖像生成模型的進步有目共睹,畫面越來越精緻,風格也越來越多元。
然而,當需求從「生成一張好看的圖」轉向「完成一項實際工作」時,侷限便隨之顯現。例如,模型可以生成一張驚豔的寫實人像,卻難以渲染一份排版精確的數學試卷,或是一頁公式複雜的學術論文,甚至無法修復破損的古畫。Qwen-Image-3.0的目標正是讓圖像從「好看」真正走向「好用」。除了文字與圖表生成,Qwen-Image-3.0也保留了前代模型在風格多樣性與畫質上的優勢,同時在理解複雜指令與長文本描述方面有顯著提升。這意味著使用者可以輸入更詳細的場景描述,模型便能一次生成符合所有要求的完整圖像,減少反覆修改的次數。
這一代模型特別適合需要大量文字與圖像結合的場景,例如教育領域的試題插圖、學術簡報的圖表製作、跨國企業的多語言宣傳品設計,以及內容創作者的分鏡繪製。過去這些工作往往需要設計師、排版師與翻譯人員協作,現在透過AI模型可以大幅縮短流程,讓創作者更專注於核心創意。值得注意的是,Qwen-Image-3.0在處理「知識圖解」方面表現突出。過去的模型很難同時生成正確的數學公式、幾何圖形以及邏輯推導步驟,因為這些元素對文字與圖形的對齊要求極高。而新模型透過長上下文理解與字體渲染技術,能夠在單一圖像中整合多種訊息,且保持可讀性與正確性。
此外,該模型也支援生成複雜的UI介面,對於軟體開發者與設計師而言,可以快速產出高保真度的原型畫面,減少從概念到實作的時間成本。這項能力同樣受益於超長輸入與多語言支援,能夠針對不同語言市場定製介面內容。阿里千問團隊強調,Qwen-Image-3.0的開發目標是降低AI圖像生成在商業應用中的門檻。過去模型生成的圖像往往只能用作裝飾或靈感參考,難以直接投入生產,因為文字錯誤、排版混亂等問題無法避免。而新一代模型透過精準的文字渲染與結構化生成,讓輸出的圖像可以直接用於印刷、網路發布或產品設計,真正實現「落字成畫,字字如印」的願景。目前Qwen-Image-3.
0已經開放給開發者與企業用戶在阿里雲平台上進行測試與整合。未來阿里千問計畫持續優化模型在專業領域的表現,例如醫學圖解、工程圖紙等需要高度精確性的場景,進一步拓展AI圖像生成的應用邊界。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。