全SOTA!不止純文本,阿里多模態站上全球第一梯隊
作者 | 李水青 編輯 | 漠影 8月21日報道,過去一個月,阿里巴巴模型發佈全面提速,大語言、圖像、語音、視頻、音樂五大類模型密集完成重要版本迭代,性能均躋身國際第一梯隊。有業內人士評價,多模態是下一代智能的範式。阿里在多模態上的佈局節奏,遠比市場感知的要快。模型密集迭代的另一面,是模型能力開始與雲基礎設施的增長形成更緊密的聯動。2027財年第一季度(對應2026年4月1日-6月30日),阿里雲外部商業化收入增速提升至45%,創下22個季度新高。AI雲及算力服務收入484.37億元,經調整EBITA達到56.28億元,同比暴增133%。AI相關產品收入123.
76億元,連續第12個季度保持三位數同比增長。在AI進入價值兌現期的當下,多模態也正在從模型榜單上的“能力補齊”,走向更廣泛的產業場景,成為觀察阿里AI進展的一條重要暗線。一、阿里AI不只有語言模型,多模態全面開花 剛剛過去的一個月,阿里在模型發佈上按下了加速鍵。大語言模型方面,8月發佈的Qwen3.8-Max總參數達到2.4萬億,在當時編程競技場CodeArena排名全球第三,在Artificial Analysis Agentic榜單登頂全球第一。Qwen3.8-27B開源僅兩天,下載量就突破100萬次。截至8月,阿里累計開源模型超過460個,Qwen系列全球下載總量突破30億次。
芯片廠商和推理框架也在快速跟進。平頭哥、英偉達、AMD、沐曦、聯發科、摩爾線程等國內外芯片廠商Day0適配Qwen3.8,vLLM、SGlang、Ollama等開源社區第一時間優化推理框架。Qwen已經成為全球AI產業鏈的基礎件之一。但把時間線拉長到整個季度,會發現更密集的變化其實發生在多模態。6月22日,視頻生成模型HappyHorse 1.1發佈,重點升級動態表現力、主體一致性、指令遵循、視覺質感和音頻能力。7月21日,Qwen-Image-3.0發佈。它支持最長4.5k Token輸入,可生成包含公式、幾何圖形、邏輯推導的知識圖解和複雜UI,同時支持12種語言、20多款字體原生渲染。
8月5日,該模型登上Arena.ai文生圖榜單國內第一。語音方向同樣連續更新。7月,阿里連續發佈實時語音識別模型Fun-ASR-Realtime、實時語音交互對話模型Qwen-Audio-3.0-Realtime,以及語音識別模型Qwen-Audio-3.0-ASR-Flash。Qwen-Audio-3.0系列的ASR、TTS、Realtime三類模型在Artificial Analysis今年7月的相應語音榜單中均拿下全球第一。8月6日,Wan3.0公測,單次視頻生成時長達到30秒,並首次在文本、圖片、音頻、視頻之外支持doc、xls、ppt、pdf、md等文檔輸入。
8月17日,AI音樂模型HappyShrimp上線,可以完成從作詞、作曲、編曲到演唱的端到端整麴生成。甚至在更前沿的世界模型方向,阿里也已經推出HappyOyster 1.0,能夠根據一句話或一張圖生成可互動、可探索、可實時改變的數字世界。語言、圖像、語音、視頻、音樂、世界模型,一張覆蓋越來越完整的模型版圖已經浮現。模型能力的擴張,也正在體現在收入端。財報電話會上,阿里透露,本季度,阿里AI相關產品ARR突破495億元,包括MaaS在內的模型與應用服務收入(ARR)突破160億元人民幣。至少從財報看,模型已經從技術投入逐漸變成一項規模化收入來源。
二、從榜單到場景,多模態開始走進產業一線 大語言模型的商業化路徑正在變得清晰。Anthropic靠Coding能力打開高價值企業市場,Cowork進一步把模型帶入真實工作流。Qwen3.8在編程和專業辦公能力上的大幅提升,正是沿著這條被驗證的路徑推進,從而獲得市場的初步認可。但市場可能忽略了一點,多模態也已經跨過模型炫技階段,開始進入一線商業化場景。語音模型正在重新成為AI時代的人機交互入口。Qwen-Audio正進入會議紀要、智能客服、車載助手、智能硬件、教育等高頻場景。相比單純聊天,這些場景擁有更明確的調用頻次、付費主體和ROI。
Fun-ASR-Realtime支持16種方言和30種語言,首字延遲在百毫秒級別,已經具備大規模商用條件。圖像和視頻模型更貼近內容生產產業鏈。Qwen-Image-3.0已將複雜UI設計、多語言海報製作、知識圖解等商業素材作為重點能力,支持12國語言和20多款字體原生渲染。Wan 3.0覆蓋廣告創意、影視製作、短視頻生成、電商素材生產等環節。HappyShrimp則把生成式AI版圖進一步推向音樂創作市場。科技媒體Semafor報道,Pinterest的AI購物助手和聊天機器人採用了阿里Qwen大模型。
Pinterest CEO在財報會上表示,使用開源模型的成本不到Anthropic、OpenAI等同類閉源模型的8%。他直言,任何不用開源模型的CEO,幾乎都在浪費股東的大量資金。AI對阿里核心業務的反哺也在加速。千問App深度集成淘寶天貓、淘寶閃購等生態,上線以來已有2.5億用戶通過其智能體功能實現AI驅動的購物體驗。AI正在從技術能力轉化為真實的商業場景。三、能力越補越齊,阿里多模態的價值開始顯現 AI真正進入產業後,客戶需求天然就是多模態的。佈局多模態模型,有望幫助阿里覆蓋更多需求,消耗更多雲資源,帶動更多配套服務。首先,多一個模態,對應的往往就是一類新的需求和一批新的客戶。
比如,一家汽車公司既需要語言模型理解指令,也需要實時語音完成交互;影視、遊戲、廣告行業的需求則天然橫跨文字、圖片、聲音和視頻。其次,多模態任務還會產生更重的計算需求。高清圖片、長視頻、實時語音等業務,對GPU、存儲和網絡的要求都會隨之提高。阿里財報也提到,AI應用的部署、訪問和持續運行,正在直接帶動計算、存儲、網絡等通用雲資源需求增長。此外,當一個客戶同時使用文本、圖像、視頻和語音模型後,需求鏈條還會繼續延伸到數據處理、模型微調、數據庫、對象存儲、安全等環節。原本的一次模型調用,可能變成一整條AI生產鏈,也有望進一步提升客戶黏性和綜合客單價。
而支撐這套模型體系持續向前的,是阿里近幾年不斷加厚的全棧AI底座。在組織層面,今年3月,阿里成立Alibaba Token Hub事業群,由吳泳銘直接負責,以“創造Token、輸送Token、應用Token”為核心目標重新整合AI業務。芯片層面,阿里自研真武AI芯片已經通過阿里雲服務進入20多個行業、超過650家外部客戶,覆蓋訓練、微調和推理等AI工作負載。吳泳銘在財報會議中提及,阿里正在數據中心大規模部署自研倚天/真武體系芯片,並希望逐步替換外購商業芯片,以提高AI雲毛利率。基礎設施層面,阿里雲持續擴張全球AI數據中心佈局,擴建完成後將覆蓋30個地域、104個可用區。其新一代CUBE 5.
0架構已將大型AIDC數據中心交付週期壓縮至100天,建設成本較上一代降低約10%,今年還計劃將模塊化數據中心全球產能提升兩倍以上。結語:AI進入兌現期,多模態價值正在被重新認識 過去兩年,Qwen的純文本語言模型幾乎是外界觀察阿里AI的第一窗口。但這其實只是冰山一角。在大眾視線之外,阿里的多模態模型(圖像、語音、視頻、音樂等)正在密集迭代。阿里的 AI 版圖,早已從單一的語言模型,擴展為更完整的多模態智能體系。隨著AI從聊天走向內容生產、辦公、電商和真實世界交互,多模態的重要性還會繼續上升。對阿里而言,這既是一場模型能力的補齊,也是一條正在進入產業深水區的新主線。
被低估的多模態,正在走到臺前。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
