通義千問多模態模型升級
重點摘要
# 通義千問多模態模型升級 阿里通義千問團隊近日正式推出第三代圖像生成模型 Qwen-Image-3.0。不同於前兩代分別強調「精準」與「精準、多樣、完整、美觀、真實」,這次團隊只用一個詞概括目標:「真實」(Real)。新模型專注於處理實務性高的視覺內容,包括報紙排版、故事分鏡圖、考試卷等,並非僅產出吸引眼球的圖片。 Qwen-Image-3.0 可接受最高 4,500 個 token 的提示詞,賦予模型一次性構建密集版面的能力,無須透過多張圖片拼湊。
# 通義千問多模態模型升級
阿里通義千問團隊近日正式推出第三代圖像生成模型 Qwen-Image-3.0。不同於前兩代分別強調「精準」與「精準、多樣、完整、美觀、真實」,這次團隊只用一個詞概括目標:「真實」(Real)。新模型專注於處理實務性高的視覺內容,包括報紙排版、故事分鏡圖、考試卷等,並非僅產出吸引眼球的圖片。Qwen-Image-3.0 可接受最高 4,500 個 token 的提示詞,賦予模型一次性構建密集版面的能力,無須透過多張圖片拼湊。
官方示範中,一張 3×3 網格內含九張獨立資訊圖表,各自擁有文字、公式與插圖,涵蓋隧道安全車距、垂線、儒家情理說、旋轉圓柱體拋射物脫離速度、肝吸蟲生活史、右側胸痛原因、72 階群的 Sylow 定理、銀行內部控制以及動植物細胞 DNA 等主題。這張圖說明了模型能夠在單張影像中整合來自工程、哲學、物理、醫學、數學、金融與細胞生物學等高度文字與公式密集的內容。另一個展示嵌套介面的案例更具層次:影像從一個 VSCode 視窗開始,畫面內包含 Qwen Chat 螢幕,螢幕中再嵌入微信對話,而對話中又有一張手沖咖啡教學海報。四層介面從程式編輯器一路延伸至咖啡食譜,完整體現模型對複雜場景結構的掌握力。
新模型在文字渲染上達到極高水平。據團隊說明,Qwen-Image-3.0 可以產出小至 10 像素仍清晰可讀的文字。範例中包括一張富含圖文的鯨鯊資訊海報,以及一整頁虛構的代數幾何論文。該論文頁面含有多行 LaTeX 方程式,涵蓋下標、上標、大括號、分式、求和與乘積符號。另一組展示則模擬報紙版面與紅色手寫批註,乍看宛如教師親筆註記。在影像寫實度方面,Qwen-Image-3.0 追求攝影級細節。人像展示中可看見的毛孔、皮膚紋理與髮絲在逆光下的細絲。修圖示範中,模型修復了一幅受損的傳統水墨「鬥鷹圖」,填補缺失區域同時忠實保留原畫的筆觸與墨韻。多語言能力是第三大重點。
模型原生支援 12 種語言,包括日文、韓文與西班牙文等。官方亦展示其重建網站、遊戲與直播畫面的介面設計能力。在另一個編輯案例中,模型將一張昆蟲照片直接轉化為帶有分類學標示、身體特徵標籤、放大細節圖與比例尺的完整鑑定圖板。Qwen-Image-3.0 還能夠接入即時網路資料。示範中模型根據杭州天氣資訊生成一張氣象預報圖。另一張圖則將中國水墨畫家齊白石與荷蘭畫家梵谷並列於模擬直播間中,展現跨時空、跨風格的視覺趣味。阿里在今年五月才釋出直接前代 Qwen-Image-2.0。當時的技術報告重點在訓練與推論效率提升,包含一個僅需四步即可生成、而非原本四十步的快速變體。
在自己家的評測競技場上,Qwen-Image-2.0 以些微差距落後於 OpenAI 的 GPT-Image-2 與 Google 的 Nano Banana Pro。目前 Qwen-Image-3.0 僅限邀請制的 API 存取,團隊表示近期會整合到第一方應用如 Qwen Chat 中。與原始 Qwen-Image 不同,本次幾乎不會開源模型權重。成就固然驚豔,部分案例的實際價值仍有討論空間。研究者通常使用 LaTeX 撰寫與排版論文,而非直接產出圖片格式;同樣地,報紙版面與複雜資訊圖的生成,雖然單次效果驚人,但尋求可搜尋、可編輯的格式仍是生產環境的主流。儘管如此,Qwen-Image-3.
0 展示的文字渲染與多模態整合水準,無疑代表技術邁出重要一步,也為未來以影像承載高密度資訊的應用打開更多想像。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。