通義千問多模態模型升級
重點摘要
# 通義千問多模態模型升級 阿里通義千問團隊近日正式推出第三代圖像生成模型 Qwen-Image-3.0。不同於前兩代分別強調「精準」與「精準、多樣、完整、美觀、真實」,這次團隊只用一個詞概括目標:「真實」(Real)。新模型專注於處理實務性高的視覺內容,包括報紙排版、故事分鏡圖、考試卷等,並非僅產出吸引眼球的圖片。 Qwen-Image-3.0 可接受最高 4,500 個 token 的提示詞,賦予模型一次性構建密集版面的能力,無須透過多張圖片拼湊。
# 通義千問多模態模型升級
阿里通義千問團隊近日正式推出第三代圖像生成模型 Qwen-Image-3.0。不同於前兩代分別強調「精準」與「精準、多樣、完整、美觀、真實」,這次團隊只用一個詞概括目標:「真實」(Real)。新模型專注於處理實務性高的視覺內容,包括報紙排版、故事分鏡圖、考試卷等,並非僅產出吸引眼球的圖片。 Qwen-Image-3.0 可接受最高 4,500 個 token 的提示詞,賦予模型一次性構建密集版面的能力,無須透過多張圖片拼湊。官方示範中,一張 3×3 網格內含九張獨立資訊圖表,各自擁有文字、公式與插圖,涵蓋隧道安全車距、垂線、儒家情理說、旋轉圓柱體拋射物脫離速度、肝吸蟲生活史、右側胸痛原因、72 階群的 Sylow 定理、銀行內部控制以及動植物細胞 DNA 等主題。這張圖說明了模型能夠在單張影像中整合來自工程、哲學、物理、醫學、數學、金融與細胞生物學等高度文字與公式密集的內容。 另一個展示嵌套介面的案例更具層次:影像從一個 VSCode 視窗開始,畫面內包含 Qwen Chat 螢幕,螢幕中再嵌入微信對話,而對話中又有一張手沖咖啡教學海報。四層介面從程式編輯器一路延伸至咖啡食譜,完整體現模型對複雜場景結構的掌握力。 新模型在文字渲染上達到極高水平。據團隊說明,Qwen-Image-3.0 可以產出小至 10 像素仍清晰可讀的文字。範例中包括一張富含圖文的鯨鯊資訊海報,以及一整頁虛構的代數幾何論文。該論文頁面含有多行 LaTeX 方程式,涵蓋下標、上標、大括號、分式、求和與乘積符號。另一組展示則模擬報紙版面與紅色手寫批註,乍看宛如教師親筆註記。 在影像寫實度方面,Qwen-Image-3.0 追求攝影級細節。人像展示中可看見的毛孔、皮膚紋理與髮絲在逆光下的細絲。修圖示範中,模型修復了一幅受損的傳統水墨「鬥鷹圖」,填補缺失區域同時忠實保留原畫的筆觸與墨韻。 多語言能力是第三大重點。模型原生支援 12 種語言,包括日文、韓文與西班牙文等。官方亦展示其重建網站、遊戲與直播畫面的介面設計能力。在另一個編輯案例中,模型將一張昆蟲照片直接轉化為帶有分類學標示、身體特徵標籤、放大細節圖與比例尺的完整鑑定圖板。 Qwen-Image-3.0 還能夠接入即時網路資料。示範中模型根據杭州天氣資訊生成一張氣象預報圖。另一張圖則將中國水墨畫家齊白石與荷蘭畫家梵谷並列於模擬直播間中,展現跨時空、跨風格的視覺趣味。 阿里在今年五月才釋出直接前代 Qwen-Image-2.0。當時的技術報告重點在訓練與推論效率提升,包含一個僅需四步即可生成、而非原本四十步的快速變體。在自己家的評測競技場上,Qwen-Image-2.0 以些微差距落後於 OpenAI 的 GPT-Image-2 與 Google 的 Nano Banana Pro。目前 Qwen-Image-3.0 僅限邀請制的 API 存取,團隊表示近期會整合到第一方應用如 Qwen Chat 中。與原始 Qwen-Image 不同,本次幾乎不會開源模型權重。 成就固然驚豔,部分案例的實際價值仍有討論空間。研究者通常使用 LaTeX 撰寫與排版論文,而非直接產出圖片格式;同樣地,報紙版面與複雜資訊圖的生成,雖然單次效果驚人,但尋求可搜尋、可編輯的格式仍是生產環境的主流。儘管如此,Qwen-Image-3.0 展示的文字渲染與多模態整合水準,無疑代表技術邁出重要一步,也為未來以影像承載高密度資訊的應用打開更多想像。
Related
相關文章

安謀科技公開新一代NPU架構 並牽頭髮起開源AI操作系統聯盟
安謀科技在2026世界人工智能大會上首次公開新一代NPU架構「周易」X3-Pro,並牽頭髮起開源AI操作系統聯盟AIOS,展現從IP授權公司轉向平台型生態的意圖。該公司提出三條技術路徑因應端側AI資源受限問題,並推出星辰300異構計算平台,同時聯合多家晶片與模型廠商成立AIOS聯盟,以擴大在終端產品端的影響力。

天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角”
天立啟鳴於WAIC 2026發布《世界模型驅動的教育AGI白皮書》,提出以認知世界模型為核心的技術架構,試圖破解教育質量、成本、規模難以兼顧的「不可能三角」。該白皮書已落地107所學校、服務超過25萬師生,並在2026年高考中獲得86.22%的漲分率驗證。

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?
大廠AI入口大戰升級,誰是最能幹活的桌面Agent?劃重點KeyPoints2026.07.22 11:57 · 來自浙江全文4694字00:00 / 13:42實測騰訊WorkBuddy、字節豆包專業版、百度搭子、阿里QoderWork文 | 劃重點KeyPoints,作者|心怡,編輯|重點君互聯網大廠間的AI入口大戰打到了桌面端。先說一條剛出爐的消息。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App
Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。

大模型正在“變小”?
# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。