深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 萬條軌跡才是底牌

本文作者: 鄭佳美 2026-09-23 12:07 導語:代碼、視覺、安全共用一套 RL,獎勵機制也被重新設計。代碼、視覺、安全共用一套 RL,獎勵機制也被重新設計。作者丨鄭佳美 編輯丨岑 峰 剛剛,小米正式發佈並開源 MiMo-V2.6。Pro 擁有 1.02T 總參數、42B 激活參數,Flash 為 309B 總參數、15B 激活參數,兩款模型支持 1M token 上下文,並覆蓋文本、圖像、視頻和音頻輸入。如果只看這些數字,第一反應或許會覺得這又是一次模型規模升級。但這次小米投入更多篇幅討論的,其實是模型完成預訓練之後,能力還能怎樣繼續往上推。這也是為什麼後訓練成了 MiMo-V2.
6 的核心部分。小米把代碼、通用 Agent、視覺和網絡安全任務放進同一套強化學習系統,單次 RL 更新使用 1568 個 prompt,每個 prompt 生成 16 條 rollout。和普通問答不同,Agent 在這些任務裡不是生成一段文本就結束,而是要不斷讀取環境、搜索信息、調用工具、執行操作,再根據返回結果調整下一步行動。訓練對象因此不再只是最終答案,而是一整條包含狀態、決策和反饋的行為軌跡。當強化學習開始圍繞這種長軌跡展開,問題自然也變了。
模型不僅要承擔更長上下文和持續生成帶來的計算開銷,還要同時處理大量執行時間完全不同的任務,等軌跡數量真正上來以後,單純依靠成功或失敗這樣的獎勵,又很難判斷兩條都完成任務的路徑,哪一條更值得模型學習。所以 MiMo-V2.6 後面的架構、異步訓練和獎勵設計,基本都是從這些實際問題裡一步步長出來的。011M 上下文背後Agent 一旦開始長期停留在環境裡,模型面對的計算形態就發生了變化。以軟件工程任務為例,模型可能先讀取大量代碼,隨後搜索文件、修改函數、運行測試,再根據 terminal 返回繼續行動。
早期讀取的內容需要留在上下文裡,但當前一次決策真正頻繁使用的,往往只是正在處理的代碼、最近幾輪工具結果以及局部狀態。MiMo-V2.6-Pro 的注意力結構正好利用了這種特徵。70 層 Transformer 中,60 層採用 Sliding Window Attention,窗口只有 128 token,另外 10 層使用 Global Attention。也就是說,絕大多數層只處理附近信息,隔一段距離再由全局層完成長距離通信。這樣設計之後,1M 上下文並不意味著每一層、每一個 token 都要重新和完整上下文進行交互。當前操作需要的局部信息可以高頻流動,遠處的信息則通過少量全局層重新匯合。
對於長時間運行的 Agent,這比把完整注意力鋪滿整個網絡更符合實際工作負載。參數側採用了類似思路。Pro 雖然擁有 1.02T 總參數,每個 token 實際只激活約 42B 參數,每個 MoE 層有 384 個 routed expert,其中只調用 8 個。模型因此可以維持較大的專家容量,又不需要讓每個 token 穿過全部參數。這裡的意義放到 RL 階段會更明顯。一次回答多算幾個 token,成本差異有限,一次訓練裡同時生成數萬條 rollout,每條軌跡又持續幾十輪,任何單 token 計算量的增加都會被迅速放大。MiMo-V2.
6 還加入了 5 層 MTP speculative decoder,drafter 一次前向可以嘗試給出後續多個 token,再交給主模型並行驗證。官方模型卡給出的設計是一次前向預測後續 7 個 token。SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架構上的取捨:大容量負責裝下能力,稀疏計算和局部注意力控制每一步的代價,推測解碼則繼續提高生成速度。當單條軌跡能夠以更低成本持續生成,RL 才有空間把 rollout 的數量推上去。而到了 MiMo-V2.6 這種一次更新就產生兩萬多條軌跡的規模,計算壓力開始從模型內部蔓延到整個訓練系統。
02RL 開始像分佈式生產系統1568 個 prompt,每個採樣 16 條 rollout,一次更新對應 25088 條 trajectory。困難之處在於,這 25088 條軌跡不會按照統一節奏結束。有的代碼任務幾輪操作就找到問題,有的會不斷運行測試、讀取報錯再重新修改;網絡安全任務可能經歷多次環境驗證,視覺 Agent 又有不同的執行鏈路。軌跡長度、工具延遲和環境響應混在一起以後,一個 batch 內部很容易出現明顯的長尾。如果繼續採用嚴格同步方式,已經完成任務的計算資源需要等待少數仍在運行的軌跡。規模越大,這種等待造成的資源浪費越明顯。MiMo-V2.
6 用 fully asynchronous GRPO,把 rollout、環境執行、grader 和模型更新拆開運行。生成側完成一條軌跡後可以繼續領取任務,環境執行與評分各自推進,訓練側消費已經準備好的數據,不再要求一整個 batch 同時跨過每個階段。這種變化看起來屬於工程優化,卻直接影響了小米怎樣組織 RL 數據。MiMo-V2.6 沒有為代碼、通用 Agent、視覺和網絡安全分別訓練一套獨立策略,而是把多領域任務以及不同 Agent harness 混入同一次 RL,小米將其稱為 You Only RL Once。原因在於這些任務雖然環境不同,內部卻共享大量決策結構。
模型需要判斷當前狀態缺什麼信息、該調用哪個工具、執行結果是否符合預期、失敗以後應該繼續搜索還是修改方案。多個領域一起訓練,這些行為策略可以直接在同一個 policy 中發生遷移。多個 harness 的作用則更隱蔽。不同框架會改變 system prompt、工具定義和上下文組織方式,模型反覆面對不同交互外殼後,就更難把某一種固定接口當成解題捷徑。訓練壓力逐漸落到狀態理解、工具選擇和環境反饋這些更底層的能力上。走到這裡,Agent RL 的瓶頸已經發生了一次變化。模型能夠比較高效地產生長軌跡,異步系統也能夠持續吞吐不同環境,真正稀缺的東西開始變成軌跡裡的有效反饋。
因為 25088 條 trajectory 並不天然等於 25088 份高質量訓練信號。03從 GRS、GAR 到 MOPD2傳統可驗證 RL 很依賴 binary reward。代碼通過測試得到正向獎勵,失敗則沒有。對於短任務,這種反饋已經足夠清晰,但放進幾十步甚至更長的 Agent 軌跡以後,大量過程差異會被壓成同一個數字。假設同一道任務生成 16 條 rollout,其中 5 條通過測試。一條可能快速定位根因,只修改必要代碼。另一條經歷大量無效搜索,還有一條雖然通過測試,卻引入許多額外修改。只看 pass / fail,這幾條成功軌跡很難拉開差距。MiMo-V2.
6 因此把 grader 從結果檢查器進一步變成組內比較器。GRS,也就是 Groupwise Reward Synthesis,會同時觀察同一道任務產生的多條 rollout,從它們之間已經出現的差異中構造 task-specific rubric,再把過程質量與測試結果結合起來。評價標準因此會隨著當前 policy 實際暴露出來的問題發生變化。GAR(Groupwise Advantage Redistribution)則進一步影響策略更新。即使幾條 trajectory 全部完成任務,grader 仍會繼續比較它們,再把更多 advantage 分配給質量較高的方案。
官方也明確提到,這套過程會結合環境加固、異常篩查和 verifier cross-check 來處理 reward hacking。這裡帶來的變化很直接:RL 的計算投入不再只用來製造更多樣本,還開始投入到理解樣本。當 rollout 數量已經很大時,再增加一批只有 0 和 1 的軌跡,信息增量可能有限,grader 如果能夠繼續拆出成功方案之間的質量差異,同樣一輪環境交互便能產生更豐富的梯度信號。可驗證任務能夠依賴這一套機制,開放式 Agent 卻還有另一類困難。很多任務缺少穩定的自動 verifier,即使模型完成了一段複雜操作,也很難僅靠環境給出可靠評分。MiMo-V2.
6 在混合 RL 之後又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它會複用 Teacher trajectory 和 SFT demonstration 中已經存在的歷史,把軌跡截取到某個中間狀態,再讓學生從這裡繼續 rollout。假設一條 Agent 任務需要 40 步才能到達關鍵決策位置,訓練這個位置時就不必反覆生成前面 39 步。歷史狀態可以直接作為 prefix,訓練資源集中到後續決策,同時一條教師軌跡還能提供多個可複用的訓練起點。
GRS 和 GAR 解決的是可驗證任務中反饋過粗的問題,MOPD2 則把高質量教師軌跡中的決策信息帶進難以自動評分的區域。(公眾號:)MiMo-V2.6 也因此把 RL 的擴張從 rollout 數量繼續推進到了反饋密度和軌跡複用。04Agent RL 正在從算法變成系統工程MiMo-V2.6 給出的信號,其實已經超出了某一種 RL 算法本身。Agent 進入真實環境以後,訓練數據不再只有靜態 token,還多出了狀態、工具調用、執行結果、錯誤反饋和連續決策。模型需要親自走過這些過程,才能產生一條能夠用於強化學習的 trajectory。這也讓後訓練的競爭維度發生了擴展。
模型架構要能夠承受長時間生成,分佈式系統要持續運行大量異步環境,grader 要從成功軌跡中進一步拆出質量差異,教師軌跡還要被複用到難以自動驗證的任務裡。MiMo-V2.6 依然運行在人設計的任務、環境、評分機制和訓練框架內,但它展示出一種很清晰的方向:Agent 能力提升越來越依賴整個訓練閉環的吞吐和反饋質量。參數繼續擴大當然還有價值,只是到了 Agent 階段,另一個變量已經越來越難忽略 —— 一套訓練系統能夠生產多少有價值的行為軌跡,又能從這些軌跡裡轉化出多少有效的學習信號。MiMo-V2.6 的技術意義,更多就落在這裡。參考鏈接:https://mimo.xiaomi.
com/zh/mimo-v2-6上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 AI 大模型 人工智能 Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA ...樂享以太大模型,讓中國具身智能坐上定義席 做每個人的專屬AI助理,千問加速打造Personal Agent ...做每個人的專屬AI助理,千問加速打造Personal Agent ...
鄭佳美 編輯 發私信 當月熱門文章 DeepSeek V4 多模態開源,我們把它的視覺鏈路拆了一遍 拆解 Claude 5.1:38 小時不睡覺的背後,Anthropic 正在終結「模型論」 GPT、Claude 遭遇竊聽門:換個模型就能讓思維鏈不再隱身?Jalapeño 跑分炸場,GPU 推理路線開始分裂?Claude Code 額度回落:Agent 正在製造新的「祖傳代碼屎山」?最新文章 Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token?
國產大模型企業半月「連籤三單」,中國 AI 出海正在加速 OpenAI:為了不被殺死,Agent 竟學會了靠上下文「轉世重生」 英偉達開源 IMO 金牌配方:不僅是「人海戰術」,1.5TB 顯存做實 AI「 推恩令」?英偉達開源 IMO 金牌配方:不僅是「人海戰術」,1.5TB 顯存做實 AI「 推恩令」?橫掃四榜,DM0.5 憑什麼面面俱到?熱門搜索 AI 華為 iPad 創業 摩托羅拉 銀行 Kickstarter 螞蟻金服 拼多多 夏普 LIDAR
Related
相關文章

啟仔遠仔,想成為第一個被你帶回家的硅基夥伴
啟元 T1,兩款機器人當天開售,基礎版本售價 19999 元。這是整個行業第一次有人把量產消費級人形機器人推進市場,且發售即發貨,10 月 1 日啟元就將按訂單陸續發貨。01Q1與T1,同一個問題的兩種回答啟元這次發佈的兩款機器人,一個叫 Q1(暱稱“啟仔”、“Q仔”),一個叫 T1(暱稱“遠仔”)。

刷視頻也能教會機器人幹活!1200億tokens人類動作預訓練,誤差按冪律下降
個陌生家庭。它要收拾散落在客廳裡的玩具、疊毛巾、鋪床。機器人到達現場後,不再採集新數據,不更新模型權重,也不根據現場執行結果重新選擇模型。 視頻很容易被概括成“人形機器人‘零樣本’做家務”。嚴格來說卻並非如此。三個任務此前都在其他環境中用專門數據做過適配。

當 AI 開始給自己動刀,“智能爆炸”可能真不遠了:兩篇論文拆解AI下一步進化路徑
硅谷Tech news2026.09.23 10:17 · 來自北京全文6004字00:00 / 14:22當 AI 開始“改進自己”,AI 的下一個躍遷,取決於在群體中相互成就。最近,AI 圈同時被兩件事刷了屏:一邊是 MIT 材料科學家 Markus J.
千問辦公將接入阿里雲上的Salesforce
本文作者: 徐咪 2026-09-23 10:53 導語:9月22日消息,千問辦公將接入阿里雲上的Salesforce(Salesforce on Alibaba Cloud)。此次接入將結合千問辦公的企業上下文理解、 9月22日消息,千問辦公將接入阿里雲上的Salesforce(Salesforce on Alibaba Cloud)。
世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管
報告指出,雖然人工智能正在以前所未有的速度重塑健康研究、加速科學發現並改善醫療成果,但在缺乏強有力的倫理防線與監管 oversight 的情況下,AI 醫療研究也可能引入新的風險,從而危及人權、社會公平以及公眾信任。在現有的倫理審查機制方面,世衛組織警告稱,傳統的審查體系往往難以應對人工智能帶來的新型風險,包括算法透明度、偏見、公平性、問責制、隱私保護,以及快速部署 AI 工具可能引發的潛在危害。
Grok Bot 上線僅一個月,周活躍用戶數正式突破 40 萬大關
根據最新行業報道顯示,由馬斯克的 SpaceX AI 團隊推出的 Grok Bot 人工智能智能體在上線大約一個月後,其周活躍用戶數已經成功突破40萬大關。具體數據表現十分亮眼。截至9月14日的統計數據顯示,Grok Bot 的用戶規模已迅速攀升至41.