MiMo-V2.6剛發,小米羅福莉扔出MiMo-V3新架構!引用DeepSeek多項成果

(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日報道,昨晚,小米MiMo大模型負責人羅福莉發文,提前披露了MiMo-V3的新架構,其核心組件HySparse2率先登場,相關技術論文同步公佈。▲羅福莉發文 簡單來說,這套新架構主要解決Agent越做越多輪之後出現的三個問題:長輸入算得太多、緩存佔得太大,以及如何從越來越長的上下文裡準確找到需要的信息。羅福莉直接給出了一組數據:與MiMo-V2.
6採用的Hybrid SWA架構相比,在100萬Token上下文下,HySparse2處理長輸入時所需的預填充(Prefill)計算量降至約1/5,KV Cache佔用降至約1/4.5;與此同時,其長上下文檢索表現進一步提升,AgentPPL和LongPPL也有所下降。▲HySparse2在長上下文表現、Prefill計算量和KV Cache佔用上的對比 HySparse2論文由小米LLM-Core團隊完成,共有15位作者,羅福莉為通訊作者並標註為Team Lead。論文參考文獻裡還出現了不少業內熟悉的成果。
其中,DeepSeek相關成果共有4項,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;此外,OpenAI的gpt-oss模型卡以及GPT-4.1相關評測工作也在引用之列。▲HySparse2論文引用的4項DeepSeek相關成果 值得注意的是,距離小米上一輪模型更新,才過去兩天。9月22日,小米大模型團隊剛剛發佈並開源新一代Xiaomi MiMo-V2.6系列,並預告後續將逐步開放MiMo-V2.6-Pro-UltraSpeed。相比MiMo-V2.6-Pro,後者在同等智力水平下輸出速度提高20倍。
小米還同步開源了用於新模型訓練的RL環境、框架以及模型技術報告。羅福莉當時稱,MiMo-V2.6押注大規模RL擴展,進行了開源模型迄今最大規模的單次RL訓練,團隊將其視為探索RSI(遞歸自我改進)、通往AGI的新一步。MiMo-V2.6剛剛把大規模RL擺到臺前,這一次,小米把刀落到了模型底層架構上。一、Agent多輪任務,帶來更高的長輸入成本 HySparse2解決的問題,與Agent越來越典型的一種工作模式有關:模型生成的動作很短,工具返回的內容卻可能很長。例如,Agent可能只生成一句搜索指令或一次工具調用,隨後搜索引擎返回一篇長文檔,代碼工具返回大量運行日誌。
模型進行下一輪推理之前,需要先把這些新增內容處理一遍。這個過程就是Prefill,也就是預填充。當Agent連續調用搜索、代碼執行、文件讀取等工具,文檔、網頁和運行記錄會不斷進入上下文。模型既要反覆處理這些新增輸入,還要保存越來越大的KV Cache,並在幾十萬甚至上百萬Token的歷史信息中找出當前真正需要的內容。論文因此把長週期Agent推理面臨的問題歸納為三個方面:降低Prefill計算量、減少KV Cache佔用,以及提高長上下文檢索準確率。上一代HySparse已經做過一輪優化。
它把全注意力層和稀疏注意力層交替排列,後面的稀疏層可以複用前一個全注意力層生成的KV Cache和選擇索引,從而減少注意力計算和緩存佔用。不過,在Prefill階段,HySparse仍需要依次執行全部網絡層。到了HySparse2,小米進一步把Prefill的執行路徑縮短:處理長輸入時,模型跑完前半部分,就可以完成後續推理所需KV Cache的構建。二、兩級KV共享,讓模型少跑一半 實現這一點的核心,是HySparse2採用的兩級KV共享。第一層叫KV Bridging。HySparse2把模型主體分成Self-Decoder和Cross-Decoder兩部分。
前者由全注意力和滑動窗口注意力組成,後者則由全注意力和稀疏注意力組成。在Cross-Decoder中,全注意力層生成K和V時,可以直接使用Self-Decoder對應全注意力層產生的隱藏狀態。這樣,後半部分無需再完整處理一次此前輸入的全部Token。第二層是KV Reuse。進入Cross-Decoder後,一個全注意力層生成的KV Cache和Token選擇結果,還會繼續提供給後續多個稀疏注意力層複用。兩級共享疊加後,Cross-Decoder所需的KV Cache都可以根據Self-Decoder的隱藏狀態構建。
▲HySparse2的兩級KV共享架構 Prefill執行完Self-Decoder即可退出,無需再讓後半部分完整跑過一次長輸入。HySparse2還調整了尋找長上下文信息的方式。上一代HySparse採用Block級選擇,即一次選取一整塊連續Token。HySparse2則改成了Token級選擇,可以直接從上下文不同位置尋找相關Token。這種變化更適合多輪Agent任務。比如一條真正有用的信息可能藏在很早之前的一次工具返回中,Block級方案為了取出其中一個Token,還需要一併處理周圍的一整塊內容;Token級方案則可以直接選擇需要的位置。
論文消融實驗顯示,在相同注意力預算下,Token級方案在RULER-v2、MRCR-v2和GraphWalks等長上下文檢索與圖推理測試上均取得了更高得分。▲Token級與Block級稀疏選擇效果對比 HySparse2同時取消了Cross-Decoder中單獨的SWA分支,改為強制保留最近一段上下文。論文實驗中,每次固定保留最近128個Token,再從更早的上下文中選擇1024個Token。近期信息和遠距離信息因此能夠共用同一份KV Cache,也減少了額外緩存。
以論文展示的49層模型為例,在Prefill與Decode分離部署時,Prefill節點只需要部署前25層,所需模型權重接近減半;這一階段只需要執行一個全注意力層。三、長上下文和Agent任務,效果提升更明顯 為了驗證HySparse2,小米團隊訓練了一組80B-A3B MoE模型,並與上一代HySparse以及MiMo-V2系列採用的Hybrid SWA進行比較。三組模型採用相同的數據和訓練計劃,僅注意力架構不同。模型首先使用約5000億Token進行預訓練,上下文長度為32K;隨後又使用約1000億Token進行輕量後訓練,並將上下文長度擴展至256K。
測試結果顯示,HySparse2較明顯的提升集中在長上下文檢索和Agent任務。經過後訓練後,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分別提高11.30和19.81個百分點;相比Hybrid SWA,則分別提高6.44和18.65個百分點。在256K上下文下,HySparse2的RULER-v2得分達到58.45,HySparse為32.61,Hybrid SWA為35.74。與此同時,HySparse2在論文測試的各個上下文長度下,AgentPPL和LongPPL均低於另外兩種架構。
▲HySparse2在長上下文及Agent任務上的表現 計算和緩存方面的差距更加直接。在100萬Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至約34%,相比MiMo-V2系列採用的Hybrid SWA降至約20%。同一條件下,HySparse2的KV Cache佔用為2.69GB,HySparse為6.72GB,Hybrid SWA達到12.09GB。換算下來,相比Hybrid SWA,HySparse2的緩存佔用降至約1/4.5。
▲不同架構在長上下文下的Prefill計算量和KV Cache佔用對比 在通用能力部分,小米團隊給出的結論相對剋制:三種架構在知識、推理和代碼等能力上的整體表現大致相當,不同測試項目各有高低。例如,HySparse2在BBH和MMLU-Pro上的成績更高,HySparse則在DROP等項目上表現更好。▲HySparse2與HySparse、Hybrid SWA在知識、推理、代碼及長上下文任務上的表現對比 相比這些常規測試,HySparse2在RULER、NoLiMa等長上下文任務上的提升更加突出。論文還通過消融實驗驗證了不同設計帶來的影響。
例如,取消獨立SWA分支、採用強制局部窗口後,部分數學推理和MRCR-v2成績有所變化,但這一設計省去了額外投影參數和局部KV Cache,同時讓Prefill可以在模型中途直接退出。小米團隊將其視為效率和模型能力之間的一項架構取捨。結語:MiMo-V3箭在弦上,羅福莉搶先亮劍 MiMo-V2.6剛剛發佈兩天,羅福莉已經提前透露了MiMo-V3的一項關鍵架構變化。按照論文中的設計,HySparse2通過兩級KV共享,讓Prefill階段只需運行大約一半模型,同時進一步減少長上下文計算量和KV Cache佔用,並在多項長上下文、Agent任務上取得更高得分。
這也讓MiMo-V3的一個技術方向提前變得清晰:面對越來越長、越來越多輪的Agent任務,小米正在繼續壓縮模型處理長輸入的計算與存儲成本。從MiMo-V2.6押注大規模RL,到MiMo-V3提前亮出新的底層架構,小米MiMo團隊的模型迭代節奏還在繼續加快。接下來,HySparse2會如何落到完整的MiMo-V3上,以及這套架構最終能帶來怎樣的實際表現,也值得繼續關注。
Related
相關文章

OpenAI、Anthropic同日模型大戰,“是兄弟就砍一刀”
光錐智能2026.09.24 16:43 · 來自廣西全文3968字00:00 / 10:28刀刀見骨,AI巨頭為自己畫過的大餅“填窟窿”文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏9月23日凌晨,OpenAI和Anthropic像約好了一樣,前後腳各自放出新模型:OpenAI端出了GPT-6 Sol和GPT-6 Luna兩款模型,把旗艦GPT-6 Astra的能力蒸進更快更便宜的型號裡;Anthropic則亮出Claude Opus 5.5,性能追平Fable 5.1的同時,成本只有上代Opus 5的六成。

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言
該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。

消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市
該業績躍升主要得益於近期產品定價的上調,以及其系列模型在開發者與企業端持續攀升的採用率。DeepSeek首席執行官梁文峰在近期舉辦的投資者會議上披露了這一核心財務數據。此舉被視為在資本市場關鍵節點提振投資人信心的重要舉措——目前DeepSeek正接近完成第二輪融資,並緊鑼密鼓地籌備在上海證券交易所上市。

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底
作者:清源 責編:清源 評論: 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。

ChatGPT 移動端上新語音智能體:動動嘴就能寫文檔、總結郵件
據瞭解,Pro 和 Plus 訂閱用戶可在手機上使用"工作"創建文檔、撰寫電子郵件或總結 Slack 消息,還能執行創建網站、製作 PPT、使用雲端瀏覽器等進階操作;Free 和 Go 訂閱用戶則可使用插件與已連接的應用。OpenAI 表示,ChatGPT 的語音對話將提供更豐富的文本輸出,Plus 訂閱用戶可在文本與語音之間輕鬆切換,或者先在手機上處理工作、再轉移到電腦上繼續。