羅福莉沉寂半年官宣小米強化學習!直播新模型訓練過程,一小時燒3萬美元

2026年9月17日 09:11
羅福莉沉寂半年官宣小米強化學習!直播新模型訓練過程,一小時燒3萬美元
站內 AI 整理稿

小米新模型的強化學習訓練,直接開了現場直播。點進去一看,這哪是訓練現場啊,這就是燒錢現場,一眨眼就是10美刀,一分鐘就是4000多元人民幣出去了。當然燒錢的速度可能不是均勻的,從pro模型開始訓練算起36小時,兩款模型已經花了超過108萬美元,平均每小時3萬美元。要是別人幹這事得喊一句誤闖天家,但是小米幹這事只能喊一句誤闖米家了。在這個頁面上,訓練花了多少錢、跑了多少步、獎勵曲線漲沒漲、哪個節點的顯卡出了故障,全部公開可查。見過開放權重、開放訓練代碼和開放訓練數據的,開放訓練過程的還真是沒見過,圍觀群眾紛紛大呼過癮。那麼目前MiMo-V2.6的Flash和Pro兩款模型訓練得怎麼樣了?

其實還在初期,畢竟剛開始訓練1天多一點。不過已經能看出兩者在RL過程中都有了比較明顯的能力提升: Pro的dynsam/avg@n從第1步的約0.565提升至0.614,Flash則從約0.514提升至0.603;最新公開的DeepSWE v1.1離線評測中,Pro和Flash分別達到62.24和60.77。(對比DeepSeek-Flash v1.1是74.2%) Flash從更低的起點快速追近,Pro目前只保持小幅領先。不過Pro訓練完一個Step更慢,所以最新的評分還沒出來。自4月份開源MiMo-v2.5後,小米沉默了近半年。

現在負責人羅福莉出來解釋,這期間只研究了一件事:強化學習能擴展到多遠。小米公開如何Scaling強化學習 傳統的預訓練scaling很容易理解:更多數據 × 更多參數 × 更多算力 → 更強模型 現在前沿模型越來越關注RL能不能也這樣scaling?也就說如果持續增加: 每輪生成多少軌跡; 模型面對多少種真實任務環境; 為判斷這些軌跡好不好投入多少計算; 模型能力是否還能持續提高?小米給出的答案是沿三個維度擴展:訓練計算量、環境/執行框架、評分計算量。####訓練計算量的Scaling 第一個維度最直觀,就是把RL本身的計算規模做大。MiMo-V2.

6系列每個訓練Step大約會處理20億Token,配置為1568個Prompt × 每個Prompt 16條Rollout。也就是說,同一道題並不是只讓模型回答一次,而是讓它嘗試多條不同的解題和行動軌跡,再從這些嘗試中獲得強化學習信號。1568×16意味著一輪就可能產生超過2.5萬條Rollout。而對於Agent任務來說,一條Rollout又遠不只是“一問一答”:模型可能要經歷幾十輪思考、工具調用、環境反饋和再次行動,因此最終一個Step的Token數可以達到數十億級別。更重要的是,整個系統採用了Fully Async,也就是完全異步的執行方式。

傳統意義上可以把一次RL訓練想象成一條整齊的流水線:先把所有樣本生成完,再統一評分,然後訓練模型,最後開始下一輪。但大規模Agent RL很難這樣等待。在MiMo的系統裡,不同任務可以同時處於不同階段:有的Agent還在環境中執行任務,有的已經完成、等待判分,有的正在計算Reward,還有新的任務正在進入系統。生成、執行、評分和訓練不再嚴格排隊,而是組成了一套持續運轉的異步流水線。環境的Scaling 第二個擴展方向是Environments and Harnesses,也就是訓練環境和執行框架的擴展。MiMo-V2.

6做的是Multi-task Agentic RL:代碼、通用任務、視覺、Chat等不同類型的任務,可以被混合到同一次RL Run中訓練,而且這些任務還可以運行在不同的Harness裡。例如一個編程Agent的Harness可能允許模型打開終端、修改代碼、執行測試、閱讀報錯,然後繼續修改;另一個視覺Agent面對的則可能是一套完全不同的工具、環境反饋和成功條件。因此,MiMo想擴展的除了“題目數量”,還有模型能夠進入多少種環境、使用多少種工具、解決多少種類型的問題。

這也是為什麼直播頁面會專門展示Batch Composition:這一欄實際上是在告訴外界,每一個訓練Step中,模型正在從什麼樣的任務和環境裡獲取經驗。評分的Scaling 第三個Scaling方向則更容易被忽略:Grader Compute,也就是給打分本身增加算力。強化學習需要獎勵,但複雜Agent任務的獎勵 並不像數學選擇題那樣容易得到。代碼任務還可以運行Test Case:100個測試通過了多少個,就可以形成相對客觀的反饋。但面對更開放的Agent任務,僅僅判斷“最終成功還是失敗”往往遠遠不夠,負責判斷模型做得好不好的評分者,同樣開始消耗越來越多計算資源。

而這裡還有一個更加關鍵的問題Credit Assignment,也就是信用分配。假設一個Agent為了完成任務連續執行了40步:搜索資料、打開網頁、閱讀信息、編寫代碼、運行測試、發現錯誤、修改代碼,最終成功完成任務。如果系統最後只告訴模型一句“成功,Reward=1”,這個學習信號其實非常粗糙。因為模型並不知道:前面的40步中,究竟哪些動作真正幫助了成功?哪些步驟其實毫無必要?哪一次修改扭轉了整個任務?又有哪些動作雖然最後沒有導致失敗,卻實際上是不好的選擇?MiMo在這次訓練中特別提到了Agentic In-group Credit Assignment。

目前還沒有公佈具體算法,但結合“同一個Prompt生成16條Rollout”的訓練方式,可以理解其基本目標:利用同組多條Agent軌跡及其結果,獲得比簡單的最終成敗更加細緻的強化學習信號。同一組任務嘗試,哪些行為應該獲得更多鼓勵、哪些應該減少鼓勵,以及如何把這種判斷轉成訓練信號。這樣一來,MiMo所說的三個Scaling方向實際上構成了一套完整體系: 擴展計算量,讓模型產生更多經驗;擴展環境和Harness,讓模型獲得更加多樣的經驗;更多評分計算量,則負責從這些海量經驗中提取更加準確的學習信號。

當預訓練的Scaling已經發展多年之後,能否把模型與環境交互、產生經驗、評價經驗再到學習經驗的整個RL循環,也變成一臺可以持續擴大規模的機器?不過前來圍觀的大佬ViT大佬給出更直接的翻譯:三件事,背後都是算力。參考鏈接 [1] https://mimo.xiaomi.com/rl [2]https://x.com/_LuoFuli/status/2100296686719610932 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

3 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

5 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

9 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

9 小時前