阿里公佈全模態模型新進展,Qwen4和下代視頻模型均在訓練中

2026年9月22日 11:45
阿里公佈全模態模型新進展,Qwen4和下代視頻模型均在訓練中
站內 AI 整理稿

9月22日, 2026雲棲大會開幕,阿里巴巴公佈大模型最新進展。9月22日, 2026雲棲大會開幕,阿里巴巴公佈大模型最新進展。在大語言模型LLM領域,Qwen3.8-Max在編程(Coding)和辦公(Cowork)領域表現強勁,發佈後斬獲Artificial Analysis Agentic智能體第一、CodeArena前端編程第一;基於下一代架構的Qwen4已投入訓練,未來Qwen4.5、Qwen5等後續版本模型參數將擴展至5到10萬億。在多模態領域,Qwen-Image-3.1性能有望逼近最強GPT-Image 系列,躋身全球前列;Qwen-Audio-3.

1在ASR、TTS以及Realtime三個核心語音賽道均位列國際第一梯隊、國內第一,超越Gemini 3.1 TTS等國際頂尖模型;世界模型HappyOyster-2.0-Preview全新亮相,推動世界模型從實驗室走向真實可用;視頻生成模型Wan3.0斬獲Artificial Analysis 文生視頻與視頻編輯雙榜第一,同時,下一代視頻模型也在訓練中,擁有更強的生成力、控制力和理解力,推動AI從工具走向創作智能。在最新的Artificial Analysis全球大模型排行榜上,Qwen3.8-Max從40提升到45分 阿里巴巴是最早佈局AI大模型的中國科技公司。

從2019年起,阿里就開始著手AI大模型研究,陸續推出千問Qwen大語言模型系列,和萬相Wan及HappyHorse等多模態模型系列。進入2026年,阿里大模型發佈全面提速,最近1個多月時間,僅Qwen3.8系列就陸續更新迭代出4個不同模型及重大版本,性能和性價比均進入全球前沿水平,成為當前最受企業和全球AI開發者社區關注的中國模型之一。2026雲棲大會上,阿里公佈了大模型自我進化(RSI)已初步進入模型訓練、推理及模型芯片協同等環節中,這一前沿技術探索加速了Qwen系列模型的迭代升級。

傳統模型迭代通常是一條單向流水線,研究員從評測或用戶反饋中發現問題,準備一批數據,完成一次訓練,然後發佈新模型。像這樣的工作會持續重複循環,下一輪新模型仍要從人工分析重新開始。現在,Qwen3.8-Max可以通過自主搭建訓練流程、構造訓練數據,並自主設計實驗、定位缺陷,在人類完全“零參與”的情況下持續迭代超1個月,完成33輪有效迭代。基於RSI、後訓練等系列技術創新,Qwen3.8-Max的新版本在Artificial Analysis上的得分提升12.5%到45分,與Claude、GPT等頂尖模型屬於前沿梯隊。

此外,千問RSI探索還不斷延展,向上支撐推理自主優化,向下協同芯模聯合創新:在推理優化上,Qwen3.8在從未見過的平頭哥新款GPU上,自主適配優化了下代架構的Qwen3.8-Flash新模型的SGlang推理框架,實現單實例推理吞吐量提升 96%。在芯片模型協同設計上,Qwen3.8僅基於一份真實的總線模塊規範,自主展開前端、驗證、後端的全鏈路自迭代,在自主運行超60小時、調用EDA工具超萬次後,完成了減少42%面積的物理實現優化、標準單元數降低29%,功耗降低59.5%。追求更高智能並加速自我進化,是Qwen最重要的北極星目標。本屆雲棲大會,阿里公佈了大語言模型系列技術進展。

在架構優化方面,Qwen3.8-Flash(詳見技術博客)提前開源下一代千問大模型架構,通過注意力機制和模型內信息傳遞機制等核心技術創新,在實現前沿模型性能的同時,將訓練成本驟降近90%,同時依託於極少的參數激活,將推理計算效率推至全新的帕累託前沿,成為行業性價比“斬殺線”模型。在模態擴充方面(詳見技術博客),全模態模型Qwen3.8-Omni-Flash正式亮相,將視頻、音頻、圖片和文字等不同模態高效納入統一理解框架中,為大模型開闢全新的思考分區。在參數擴展方面,參數越大依然能帶來更強的性能,未來千問大模型總參數量將擴展至5萬億甚至10萬億的規模。

這些技術創新將成為新一代千問大模型的基石,據介紹,Qwen4模型正採用全新架構展開訓練,Qwen4.5、Qwen5均在穩步推進中。追求極致性價比、推動實現AI普惠,是Qwen的另一個北極星目標。Qwen3.8系列模型中,Qwen3.8-Max被Arena評為前沿編程模型中性價比最高的模型之一,相較Qwen3.7的Token調用數提升12倍,進入全棧開發、自動化運營、法律文書、投研分析、工程設計、科學研究等真實場景;Qwen3.8-Flash通過結構創新,開啟了緩存命中輸入低至每百萬Tokens0.1元的全新時代;Qwen3.8-27B被全球開發者譽為“本地Opus4.

6”,將智能密度壓縮到配備消費級顯卡的電腦也能跑的極致程度,把智能和性價比“斬殺”到新水平。事實上,全世界的企業和開發者都在用阿里大模型來探索AI應用落地。比如,硅谷AI獨角獸Perplexity基於Qwen3.

8打造本地Agent,知名互聯網公司愛彼迎Airbnb CEO布萊恩·切斯基稱公司正“大量依賴阿里巴巴的千問模型”,並直言“比OpenAI更好更便宜”;“美國版小紅書”Pinterest也用Qwen來搭建了自己的AI購物助手和聊天機器人,其CEO比爾·雷迪直言使用Qwen的成本不到Anthropic、OpenAI等同類閉源模型的8%;路透社也為降低對Claude等閉源模型的依賴並減少長期使用成本,基於Qwen開發自有模型。Qwen3.8系列模型均面向全球開源,短短一個月,Qwen3.8相關模型已下載超5600萬次,衍生模型超1900個,其中Qwen3.

8-27B超過DeepSeek-R1、Meta-Llama3.1等熱門模型,成為Hugging Face歷史上最受歡迎大模型全球第一。截至目前,阿里已開源460多個千問大模型,Qwen模型的整體下載量超30億次,衍生模型超30萬個,Hugging Face官方報告指出,Qwen已成為全球AI開源社區的基座模型,包括DeepSeek、英偉達、AWS、微軟等知名公司都基於Qwen二次開發出相關衍生模型,進行AI業務的落地探索實踐。

如果說大語言模型是機器的大腦,目的在於變得更聰明、更強大,推進通用人工智能AGI乃至超級人工智能ASI的實現;那麼多模態模型則是機器與人、世界交互的中樞,目的在於感知、理解甚至創造出新的事物,幫助機器可靠、平穩地走向真實物理世界。本次雲棲大會上,阿里巴巴多款多模態模型重磅升級,從單模態生成逐步邁向全模態理解生成一體化發展。在視頻生成領域,2025年,Wan2.6在國內首次支持視頻參考生成, 15秒時長,智能多分鏡。進入2026年,阿里視頻模型持續探索在最前沿,4月發佈的 Wan2.7 與 HappyHorse1.0在電影級質感與視覺表現力上實現躍升,8月正式上線的 Wan3.

0 支持單次30秒視頻生成、文檔/表格/網頁等結構化輸入、原生音畫同步,在 Artificial Analysis 文生視頻與視頻編輯雙榜位列全球第一。全新的下一代視頻模型也將於11月發佈,朝著更長、更可控、更完整、更智能的方向演進:在更長的時間裡,新模型仍然能保持一致性,創作者可精準掌控人物、場景與鏡頭;同時,模型能具備導演級的創作思維,從生成單個鏡頭邁向理解完整敘事。語音模型方面,阿里發佈Qwen-Audio-3.1系列語音大模型,語音轉寫(ASR)、語音合成(TTS)和實時語音交互(Realtime)三類模型全面升級。其中,Qwen-Audio-3.

1-Realtime實時交互能力再提升,能夠邊聽、邊想、邊說,並進一步增強多語言交互、角色扮演和共情能力,目前,該系列模型已應用於千問辦公和Qoder,並接入QwenNote A2隨身助理、QwenNote Eva桌面機器人和千問AI眼鏡等硬件產品。同時,阿里推出基於下一代架構的兩款全新模型:音頻創作模型Qwen-Audio-3.1-TTS-Next,用戶只要提供一段話即可一次生成融合人物對白和環境聲的完整音頻內容,滿足有聲書、影視劇、播客、遊戲、廣告等專業創作需求;音頻理解模型Qwen-Audio-3.

1-ASR-Next,它能夠理解人物情緒、音樂、環境聲與機械聲,完成聲音描述、事件定位、音頻問答與推理,讓“這段錄音中人的情緒怎樣”這樣的問題能夠被理解和準確回答。圖像生成模型方面,Qwen-Image-3.1亮相,它面向電商、設計等真實商用場景全新優化升級,將原本數小時的視覺設計壓縮至秒級交付,水準堪比專業設計師,還支持圖像精準編輯。同時,視覺生成部分參數量僅7B的Qwen-Image-2.

1全面開源(詳見技術博客),它是千問圖像系列當前能力最平衡、性價比最高的開源生圖模型,在 Qwen-Image-Bench 公開評測中超過大部分閉源模型、位居開源第一,推理速度也大幅提升;同時原生支持透明圖生成,依靠 prompt 自動決定輸出普通圖還是透明圖,還能把 RGB 實拍圖直接摳成 RGBA 圖層。此外,模型支持最高 10 張參考圖的多圖編輯、圈選/塗抹/掩碼三種局部編輯,並重點強化人像與商品的編輯保真,文字渲染與人物光影表現也較前一代明顯增強。音樂模型Happy Shrimp 1.

1版本發佈,在音樂審美建模與強化學習以及世界知識與音樂領域知識融合兩個技術方向進一步提升,實現了音樂表現、人聲質量、多語種演唱及指令理解四個專業維度的突破,支持百餘種曲風與十餘種主流語言,覆蓋人聲歌曲與純音樂兩大生成場景。同聲傳譯模型 Qwen3.8-LiveTranslate 正式亮相(詳見技術博客)。新模型採用Interleave 架構,創新重構實時同傳過程,準確度度、流暢度、簡潔度全面提升,字均延遲(LAAL)從 2.8 秒降至 2.3 秒,而人類同傳平均時延在4秒。Qwen3.

8-LiveTranslate 新增三項能力,可實現實時說話人分離,每句話歸屬清晰,音色復刻更穩定;實現原文譯文同幀同出,雙語同屏顯示;面對長上下文可自主高質量減輕乃至消除歧義,聯繫前文讀懂當下,人名術語翻譯更精準。基於系列技術創新,Qwen3.8-LiveTranslate不只是翻譯得快,聽得也更清,譯得更準,在真實場景中表現更好。世界模型最新版本HappyOyster 2.0 Preview亮相,通過對模型架構、訓練方法和數據體系的全面升級,顯著提升了智能實時交互、記憶能力、實時響應、物理規律遵循等核心能力,讓世界模型真正從實驗室走向真實可用。

本屆雲棲大會,阿里全面展現了從大語言模型到多模態模型的突破,在這持續穩定的研發產出背後,是阿里長期在AI和雲計算領域不斷投入、厚積薄發的結果。過去十七年,阿里巴巴是中國唯一具備軟硬一體垂直整合能力的全棧AI公司,阿里雲在雲技術沉澱和大模型研發上的投入也最為充分,是目前中國唯一同時在基礎設施和模型研發上具備全球一流能力的平臺。阿里組建的Token Foundry是目前中國AI人才最密集、AI產出最豐厚的AI Lab,橫跨了語言模型及最豐富的多模態模型領域。同時,阿里巴巴還有AI時代最重要的AI應用場景,包括Agent工具千問辦公、Qoder等,為各行各業提供AI生產力工具。

阿里巴巴已成為中國最重要的AI基礎設施企業和AI應用公司之一。

Related

相關文章

量子位生成式AI

阿里研究員透露Qwen4.5後模型將擴展至5-10T參數

阿里巴巴在雲棲大會上宣布新一代架構的Qwen4模型已開始訓練,未來Qwen4.5、Qwen5等版本參數規模將擴展至5至10兆。大會同時展示大模型遞歸自我改進技術已應用於訓練與推理,並推出多款影像、音樂、語音及全模態模型新版本。阿里也宣布下代視頻生成模型預計11月發布,並將語音模型落地於手機、AI眼鏡等終端裝置。

剛剛

華為雲碼道全面升級:全球首個鴻蒙專屬AI編碼智能體登場,從想法到上架一條龍

官方給它的定位很硬:這是全球首個、也是目前唯一一個專為鴻蒙生態打造的AI編碼智能體,等於給鴻蒙開發者配了一位從頭跟到尾的數字搭檔。扛大樑的是鴻蒙編碼大模型。它依託鴻蒙增強訓練體系,在訓練數據、代碼生成、編譯通過率和Token消耗這幾個開發者最在意的維度上都佔著優勢,目前已經上線可調用。

剛剛

蘋果零售先驅質疑AI代理購物:消費者不會完全交給機器

現年66歲的約翰遜曾於2000年加入蘋果,負責搭建零售業務,並參與建立後來成為蘋果產品銷售與用戶服務核心的實體門店網絡。谷歌正通過Universal Commerce Protocol推動AI代理覆蓋商品發現、比較和結賬流程,OpenAI也在將ChatGPT打造為購物平臺。

剛剛

阿里平頭哥發佈AI芯片真武V900,算力達M890三倍

基於真武V900構建的單一集群可擴展至50萬卡,可為前沿AI模型訓練與推理提供大規模算力支持。阿里表示,隨著平頭哥芯片產品線逐步成熟並獲得廣泛客戶應用,預計芯片年出貨量將大幅提升。阿里集團CEO吳泳銘透露,阿里自研M890AI超節點目前已具備支撐2萬億參數大模型推理的能力,並已於本季度規模化上架阿里雲數據中心。

剛剛

騰訊混元圖像3.5來了:畫字更準、修圖更強、一張2K圖只要一毛五

新版本在畫質、排版、修圖等核心能力上全面升級,同時大幅降低使用成本,主打"便宜又好用"。據官方介紹,Hy Image3.5preview相比上一代能力提升了約30%。在畫字能力上,模型對文字內容的還原更加精準,不再出現"缺胳膊少腿"的尷尬;排版能力也顯著增強,可以更好地理解用戶對畫面佈局的要求;修圖方面,模型支持最多5張參考圖同時輸入,用戶可以根據多張圖片的風格或元素進行融合調整,最高支持2K分辨率輸出。

剛剛