阿里發佈Qwen-Image-3.0,支持4.5K Token超長輸入與複雜圖文生成

2026年7月21日 07:326800 次瀏覽

重點摘要

AI資訊AI新閒資訊正文阿里發佈Qwen-Image-3.0,支持4.5K Token超長輸入與複雜圖文生成發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘阿里正式發佈新一代圖像生成基礎模型Qwen-Image-3.0。作為千問圖像生成與編輯系列的第三代基礎模型,新模型支持最高4.

站內 AI 整理稿

阿里巴巴於近日正式發表其全新一代圖像生成基礎模型 Qwen-Image-3.0,該模型為千問系列在圖像生成與編輯領域的第三代代表作。根據官方公布的技術規格,Qwen-Image-3.0 最大亮點在於支援高達 4.5K Token 的超長文本輸入,能一次性生成包含複雜公式符號、幾何圖形、邏輯推導流程以及多層 UI 介面等高度複雜的視覺內容,同時原生支援十二種語言與超過二十款中英文字體渲染,大幅提升商業級圖文內容的產出能力與品質。與前一代模型相比,Qwen-Image-3.0 在整體生成效能上實現了約 4.5 倍的顯著提升。

這項突破使得依賴長提示詞的應用場景,例如影視分鏡腳本、知識圖解說明、產品規格與使用說明頁等,使用者不再需要為了符合模型輸入限制而壓縮或簡化需求。相反地,使用者可以像撰寫詳細設計文件一樣,完整描述畫面的整體結構、文案內容、視覺風格以及版式細節,從而獲得更加精準且符合預期的生成結果,有效降低後續反覆修改與人工調試所耗費的時間與成本。在複雜內容的理解與生成能力上,Qwen-Image-3.0 進一步強化了語義解析與空間佈局技術。模型能夠一次生成覆蓋多個不同主題的九宮格知識圖解,同時兼顧文字清晰度與內容準確性,確保每個區塊的資訊都能正確傳達。

此外,該模型也支援複雜的邏輯嵌套指令,可根據單一用戶提示,自動生成包含網頁介面、軟體應用程式視窗、即時通訊聊天框、宣傳海報等多層次視覺元素組合的圖像,充分展現其對多維度資訊的整合與再現能力。這項技術的推出,預期將為內容創作者、設計師、行銷人員以及教育訓練領域帶來全新的工作流程。在影視與動畫產業中,分鏡設計通常需要大量文字描述場景轉換、角色動作與運鏡方式,Qwen-Image-3.0 的長文本支援讓創作者能夠直接輸入完整的腳本段落,由模型生成相對應的視覺草稿,大幅縮短前期溝通與迭代的週期。

同樣地,在知識圖解與科普內容製作上,模型能夠將複雜的科學原理、數學公式或邏輯推導步驟,轉化為易於理解的圖文並茂版面,有助於提升學習材料的直觀性與傳播效率。對於產品說明頁與電商內容而言,精確的文案排版與圖文對應一直是自動化生成的難點。Qwen-Image-3.0 原生支援多種字體渲染,並能根據使用者指定的文案長度與版式要求,自動調整文字大小、間距與圖文相對位置,確保最終輸出與設計稿的還原度。這項能力讓品牌與商家能夠更快速地產出多語言版本的產品圖片、社群貼文素材或廣告橫幅,進一步加速全球化行銷的執行速度。在技術層面,Qwen-Image-3.

0 的語義解析能力不僅限於文字層面,還涵蓋對空間關係與物件屬性的深度理解。模型能夠根據提示詞中的邏輯順序,合理安排圖中各元素的視覺層級,例如在生成多層 UI 介面時,能正確區分背景、按鈕、文字輸入框與彈出視窗的疊加關係,避免常見的視覺混淆或層次錯亂問題。這使得該模型在軟體原型設計、網頁佈局探索等專業領域也具備實用價值。此外,模型在生成複雜圖表與數學內容時,能夠準確輸出公式符號、幾何圖形標註以及邏輯推導的箭頭與流程線,對於學術論文圖表、教學講義與技術文件的製作提供了強而有力的輔助工具。

使用者僅需輸入描述性的文字,例如「畫一個包含正弦曲線與餘弦曲線的座標圖,並標註關鍵點」,模型即可生成符合要求的圖像,且圖中文字清晰可讀,無需額外後製校正。阿里巴巴此次發表的 Qwen-Image-3.0,延續了千問系列模型在語言與視覺融合領域的技術積累,並在長文本理解與複雜圖文生成的精度上取得明顯進展。隨著該模型逐步開放給開發者與企業用戶,預計將在內容創作、數位設計、教育科技與電子商務等多個垂直領域催生更多創新應用,進一步降低高品質圖像內容的產出門檻,讓專業人士與一般使用者都能更有效率地將創意轉化為視覺作品。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前