小米公開MiMo-V2.6大模型RL訓練過程 羅福莉發文確認將開源技術細節
AI資訊AI新閒資訊正文小米公開MiMo-V2.6大模型RL訓練過程 羅福莉發文確認將開源技術細節發布於AI新閒資訊時間 :Sep 17, 2026閱讀 :1分鐘9月17日凌晨,小米MiMo大模型團隊負責人、前DeepSeek研究員羅福莉在X平臺發文,首次公開旗下最新大模型MiMo-V2.6的強化學習(RL)訓練進展,並同步上線實時訓練頁面,開啟大模型RL階段的全程公開直播。此舉標誌著小米在物理世界與通用智能(AGI)道路上的探索邁入全新突破期,相關技術細節亦計劃於未來數週內逐步開源。技術架構上,MiMo-V2.6正在開展大規模多任務智能體(Agent)RL實驗。
團隊圍繞三大維度進行全面擴展:算力層面實現單步約20億Token(1568個Prompt×16次rollout)的完全異步並行;環境層面搭建支持單次運行混合多框架的代理式RL;評估層面則採用帶測試用例與量規獎勵的組內信用分配機制。直播頁面實時呈現訓練進度、Token消耗與成本指標,其中MiMo-V2.6-Pro版本訓練約1天19小時、耗資89萬美元,MiMo-V2.6-Flash時長1天14小時、耗資39.7萬美元,雙版本累計訓練成本已突破128萬美元。
作為雷軍此前從DeepSeek重磅引進的“95後”AI科學家,羅福莉曾主導達摩院多語言預訓練及DeepSeek-V2研發,於去年11月正式加盟小米並執掌MiMo大模型團隊。今年3月,上一代萬億參數模型Mimo-V2-Pro已登頂Artificial Analysis全球大模型綜合智能榜第八位(品牌榜第五)。本次MiMo-V2.6通過透明化直播與工程細節開源,展示了小米在RL Scaling Law(強化學習擴展定律)上的深度積累,也將推動前沿大模型訓練從“黑盒試錯”向“極客級過程開源”的範式演進。相關推薦財躍星辰聯合上海交大開源Alpha-R1:8B小模型如何顛覆資產配置?
財躍星辰與上海交大安泰團隊聯合開源金融推理大模型Alpha-R1。該模型以8B參數為基座,採用獨創語義門控推理與兩階段強化學習訓練框架,在金融推理樣本外評測中大幅領先通用大模型與傳統方法,主要面向資產配置等金融投研場景。Sep 10, 2026251.1k不到四百美元還能自己動手訓練!Hugging Face 推出微型開源雙足機器人MicroduckHugging Face旗下Pollen Robotics開源迷你雙足機器人Microduck,身高25釐米、重約800克,融合強化學習、Sim2Real與實時控制等技術,是迷你具身智能開發平臺。
其搭載RK3566處理器,以50Hz頻率驅動15個舵機,已掌握多種實用技能。Aug 31, 2026300.7kOpenAI 前研究員巴雷特·佐夫重返谷歌,助陣 Gemini 研發巴雷特·佐夫迴歸谷歌,任研究副總裁,加入Gemini團隊,專注強化學習與後訓練。他2016年入谷歌大腦,2022年轉OpenAI參與ChatGPT研發;今年曾因與Thinking Machines Lab CEO米拉·穆拉蒂分歧離職轉投OpenAI,如今再度離開OpenAI回谷歌,成為AI人才流動樣本。Aug 27, 2026234.1k衝擊5萬億參數終極目標!
字節跳動Seed基模團隊架構大洗牌,四大核心一級部門浮出水面字節跳動Seed為傳聞超5萬億參數的下一代大模型鋪路,近期完成深度組織架構調整,打破按模態和研究方向劃分的傳統模式,整合分散團隊以優化研發效率。Seed基礎模型新設四個一級部門,其中預訓練數據團隊Pretrain Data由李成剛負責。Aug 20, 2026293.2kOpenAI 全面升級安全體系:吸取 Hugging Face 教訓,前端模型審查最嚴OpenAI週二發佈新安全政策,重點防範模型測試期安全事件,強化開發監控與後期訓練對齊標準。
這是自Hugging Face事件後首次大規模調整,官方稱動因非僅此事件,還包括Astra模型網安能力及領域快速發展。措施包括暫停前沿強化學習、設立前30分鐘警報等。Aug 19, 2026173.3k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。