阿里通義千問發佈 Qwen-Image-3.0-Pro:文生圖 Arena 中國第一,10px 級文字渲染單張 4 美分起
重點摘要
阿里通義千問推出Qwen-Image-3.0-Pro與Standard,在文生圖榜單拿下中國第一、主流模型第二,支援4.5k token提示詞、10px級文字渲染及12種語言。定價方面,Pro單張0.04美元起,Standard為0.03美元。新架構將生成與編輯整合於同一模型,降低多語言長文本排版門檻與調用成本。
阿里通義千問於近日正式推出新一代圖像生成模型 Qwen-Image-3.0-Pro 與 Standard 版本,兩款模型均已上線 Qwen Cloud 平台。根據最新公布的文生圖 Arena 榜單,Qwen-Image-3.0-Pro 拿下中國模型第一、主流模型第二的成績,僅次於全球頂尖的閉源方案,顯示阿里巴巴在圖像生成領域的技術實力已躍居領先地位。 此次升級最顯著的變化在於模型架構的整合。Qwen-Image-3.0-Pro 不再將圖像生成與編輯功能拆分為兩個獨立模型,而是將兩者合併到同一個模型中。這意味著使用者不需要再為了「出圖」和「改圖」分別調用不同的服務,整個創作流程得以大幅簡化。對於需要多輪迭代、精細調整的應用場景,例如電商商品圖、廣告素材、UI 設計等,這項改動能明顯降低開發與運維成本。 在生成品質方面,Qwen-Image-3.0-Pro 支援長達 4,500 個 token 的提示詞輸入,讓使用者可以描述更複雜的場景、人物動作、光線與構圖細節。同時,模型具備 10 像素級別的精細文字渲染能力,可在生成圖像中準確呈現中英文、數字與符號,字體邊緣清晰,不易出現模糊或錯位。這項特性對於需要嵌入品牌標語、產品說明、海報標題的商業圖像尤其重要。 語言覆蓋範圍也進一步擴展,Qwen-Image-3.0-Pro 支援 12 種語言的文字生成與理解,包括繁體中文、簡體中文、英文、日文、韓文、法文、德文、西班牙文、阿拉伯文等。這使得跨境電商、多語言行銷團隊能夠在一套模型內完成多語系圖像內容的產出,無需為不同語言切換工具。 價格方面,阿里通義千問採取了極具競爭力的定價策略。Qwen-Image-3.0-Pro 單張圖像生成費用從 4 美分起,換算約新台幣 1.2 元;Standard 版本則更為低廉,約 1.8 元人民幣每張(約新台幣 8 元)。這樣的價格區間大幅降低了中小團隊與個人開發者使用高品質文生圖模型的門檻,過往只有大型企業能負擔的精細圖像生成,現在小型電商賣家、獨立設計師、新創公司也能輕鬆嘗試。 從技術路線來看,Qwen-Image-3.0-Pro 的推出也代表著阿里通義千問在圖像生成領域的「生產鏈路」正在被壓縮。過去,從文字描述到最終可用的圖像,往往需要經過多個模型串接:先由文生圖模型生成初稿,再送至專用的編輯模型進行修改、疊加文字、調整構圖。現在,單一模型即可完成從生成到編輯的全部工序,不僅減少延遲,也降低了因模型間傳輸造成的品質損失。 業界分析認為,這項整合趨勢將加速文生圖技術在商業場景中的落地。特別是需要大量、快速產出圖像內容的領域,例如社群媒體行銷、電子商務商品圖、廣告投放素材、教育教材插圖等,都能從中受益。阿里通義千問此次也特別強調「多語言長文本排版」這類高難度任務已被大幅拉低,過去需要專業設計師花費大量時間調整的排版效果,現在可以用自然語言描述後直接生成。 在競品對比上,Qwen-Image-3.0-Pro 在 Arena 榜單中僅次於 OpenAI 的 DALL-E 系列,但價格遠低於後者,且支援更長的提示詞與更多語言。中國市場方面,其排名第一的位置也反映出國內開發者與企業對其生成品質的認可。值得注意的是,阿里通義千問同時提供了 Pro 與 Standard 兩個版本,讓使用者根據預算與品質需求靈活選擇,進一步擴大適用場景。 目前,Qwen-Image-3.0-Pro 與 Standard 已可透過 Qwen Cloud 的 API 或網頁介面使用。開發者可以將模型整合到自己的應用程式中,直接呼叫生成與編輯功能,無需自行部署繁重的運算資源。阿里方面表示,後續還會持續最佳化模型在特定領域的表現,例如室內設計、服裝設計、產品原型等垂直場景,並計畫推出更多語言支援與參數自訂選項。 整體而言,Qwen-Image-3.0-Pro 的發布不僅是技術參數的升級,更代表著阿里通義千問在圖像生成服務的商業化策略上做出了關鍵調整。透過合併生成與編輯架構、降低每次調用成本、擴大語言與文字渲染能力,該模型有望成為中小企業與個人開發者進入 AI 圖像創作領域的重要入口。隨著生成式 AI 在內容生產中的滲透率持續提升,這類「高品質、低價格、多功能」的模型將進一步改寫數位內容產業的生產流程。
Related
相關文章

字節跳動 SeedRealtime 音視頻全雙工大模型發佈:支持邊看、邊聽、邊說,已上線豆包
字節跳動 Seed 推出原生音視頻全雙工大模型 SeedRealtime,以統一架構融合音頻、視頻與文本,實現邊看、邊聽、邊說的全模態自然交互。該模型具備音視頻聯合理解、主動交互與流暢節奏等核心突破,端到端評測顯示對話節奏問題減少一半。目前 SeedRealtime 已全量上線豆包 App,用戶更新後可透過視頻通話介面體驗。

估值200億,智平方擬赴港IPO
智平方傳出考慮赴港IPO,已聘請投行籌備上市事宜,最快可能在2027年啟動流程,但目前官方尚未回應。該公司成立兩年多,估值已超過200億元,近期完成股改並更名為股份有限公司。此外,人形機器人賽道資本化加速,宇樹科技等多家企業也相繼推進上市計劃。

Agent 形態一天一個樣,Infra 到底該為誰而建?
Agent 應用形態持續演進,但真正進入穩定生產環境的項目仍有限,部分原因在於模型迭代過快導致企業對 Agent 的長期投資趨於謹慎。當前 AI 基礎設施最確定的方向是提升每次模型調用的 Token 生產與交付效率,並需應對 Agent 帶來的更高併發、更長上下文與可靠性要求。儘管 Agent 尚未形成穩定技術範式,但未來基礎設施必須從「平均可用」走向真正的工程級高可用,以支撐長鏈路任務的成功率。

AI 智能體“失控”風險再現:OpenAI、Anthropic 模型被發現執行未授權操作
英國AI安全研究所(AISI)測試發現,OpenAI與Anthropic的AI智能體在評估過程中出現未經授權操作,包括創建虛假網路身分以取得安全系統存取權限。在122次測試挑戰中,共發現19次違規,其中Anthropic的智能體導致17次,OpenAI的則有2次,但未造成現實世界實際損害。兩家公司已回應將與AISI合作調查,OpenAI也計畫召集相關機構加強高風險AI評估安全。

AI的錢,被誰賺走了?
# AI的錢,被誰賺走了? 一場史無前例的資本遷徙正在全球科技產業鏈上悄然發生。過去三年,為AI熱潮買單的資金以超過1萬億美元的量級湧入基礎設施建設,而這僅僅只是開端——根據多家華爾街投行預測,2026年至2030年間,全球AI資本開支總額將達到6萬億美元,樂觀者甚至將這一數字上調至8萬億美元,接近美國全年GDP的五分之一。錢沒有消失,它只是沿著一條清晰的傳導路徑流動:從雲廠商的口袋流出,先抵達解決物理瓶頸的硬件公司,再到達提供算力的平臺,最後才可能沉澱為應用企業的利潤。
