小米 MiMo-V2.6 發佈並開源:Pro 與 Flash 雙版本,API 價格與前代持平

作者:問舟 責編:問舟 評論: 感謝網友 浪系青年、Domado、DonaSarkar_、星落無影、失眠症、清朗的晨風、星河之夢、麵包加泡麵、自信的眉毛、DayDayUp 的線索投遞!9 月 22 日消息,小米今日凌晨正式發佈並開源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 與 Flash 兩個原生全模態模型。小米稱這是其探索 RSI(遞歸自我改進)路徑的關鍵一步,通過規模化擴展強化學習算力,讓模型在持續的探索與反饋中拓展智能邊界。得益於 RL 算力的擴展,MiMo-V2.
6-Pro 在 Artificial Analysis Intelligence Index(AA 綜合智能指數)v4.3.2 中取得 46 分,超過 Kimi K3(44 分)和 GLM-5.3(45 分),成為當前 AA 指數上排名最高的開源權重模型,較其前代 MiMo-V2.5-Pro 的 26 分高出 20 分。小米官方同時說明,該模型與 Claude Fable 5.1 和 GPT-6 Astra(均為 53 分)等頂級閉源模型相比仍有差距。在 RL 訓練階段,MiMo-V2.6 可能是目前國產開源模型中投入 RL 算力最多的模型之一。
Pro 與 Flash 訓練歷時不到 6 天,成本分別約 262 萬美元與 85 萬美元,各完成 30 步,累計約 75 萬條軌跡。訓練任務平均通過率分別相對提升 25% 和 12%,樣本外的長程軟件工程評測基準 DeepSWE v1.1 分別提升約 17 分(48.8 至 65.7)和約 14 分(58.4 至 72.6)。本次訓練從三個維度擴展 RL 算力:更大的 Batch 與更高吞吐,單次更新使用 1568 個樣本,支持 100 萬上下文長度訓練,單步訓練 Token 達 3.5 至 3.
7B;更多任務與複雜環境,構建覆蓋 Code、General、Visual、Cyber 等方向的多任務訓練體系;更大的 Grader 算力,通過 Group 內相對比較為長程 RL 任務提供更精準的獎勵信號。能力擴展上,MiMo-V2.6 融合了 3D 空間推理、多模態感知與計算機操作能力。在遊戲開發中,用戶輸入圖片、視頻或文字後,模型可將需求拆解為多個任務,由多智能體協作完成 3D 場景搭建、交互邏輯編寫與視覺驗證。在具身仿真環境中,MiMo-V2.6 可直接以多視角相機畫面為輸入,通過視覺反饋閉環控制 Franka Panda 機械臂,完成物體抓取、顏色匹配與精準放置。
注:全模態模型指可同時處理文本、圖像、視頻和音頻等多種輸入形式的模型。科研方面,MiMo-V2.6-Pro 協助研究人員完成了全氟和多氟烷基物質(PFAS)吸附用金屬有機框架(MOF)材料的設計方案篩選,並在 Lean 4 中完成了 Li-Yorke 經典論文《週期三蘊含混沌》原始主定理的完整形式化,形成 6000 餘行 Lean 源碼,完整證明通過 Lean 內核核驗。模型未接受過針對 Lean 的專項後訓練。MiMo-V2.6 系列沿用 V2.5 系列的 API 定價:Flash 為每百萬詞元輸入 1 元、每百萬輸出 2 元;Pro 為 3 元和 6 元,並提供 99% 緩存摺扣。
在同等智能水平下,價格僅為海外模型的 1/20 至 1/60。伴隨新模型發佈,MiMo Desktop 桌面客戶端(支持 Windows 與 Mac)及會員訂閱方案同步上線,訂閱會員即可使用 MiMo-V2.6-Pro 和 Flash 模型,也可配置自己的 API Key 使用客戶端。MiMo Desktop 同步上線 MiMo-V2.6-Pro 的 UltraSpeed 超高速模式,提供最高 20 倍的推理速度。MiMo-V2.6 系列已上線 Xiaomi MiMo 開放平臺。原邀測活動將在 1 周後結束,已獲得邀測資格的用戶切換模型名稱後方可繼續使用。同時,小米全面開源 MiMo-V2.
6-Pro、Flash 模型權重與技術報告,同步開放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究資源,分享經過驗證的訓練實踐,以下是詳細開源內容:7k+ 高質量 RL 任務環境:覆蓋軟件工程、漏洞復現、知識型工作、網頁設計開發四類智能體任務。以 MiMo-V2.6-Distill-Qwen-9B 為起點展開 RL 訓練,在 11 項評測中均較 SFT 基線取得提升:SWE-bench Verified 從 61.1 提升至 66.2,MiMo Cyber Bench 從 31.3 提升至 47.0,Terminal Bench 2.1 從 37.1 提升至 52.
8,MiMo Visual Coding 從 64.0 提升至 72.4;端到端 RL 訓練框架:基於 verl、uni-agent 和 mini-swe-agent,覆蓋環境交互、軌跡採集、獎勵評估與策略優化的完整訓練流程。結合開放的模型與任務環境,支持社區圍繞訓練算法、獎勵機制和 agent harness 開展研究與迭代;輕量可組合的 Harness:開源極簡 mini-harnesses,將系統提示、工具與上下文管理解耦,構建多樣且可控的訓練配置。
通過 Multi-Harness Training,能夠將多樣性和整潔性納入 RL 訓練,提升模型在不同框架、包括未見框架上的泛化能力,支持社區自由組合框架組件、拓展訓練配置,持續探索新的研究方向。廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:小米,開源大模型,MiMoV2.
6小米 69 元米家夜燈 4 開售:支持磁吸 / 懸掛 / 粘貼 + 8 個月長續航小米推出米家即熱飲水機 Pro:3 秒即熱出水,399 元小米雷軍回應“武漢街頭吃熱乾麵”爭議:幫助文旅宣傳家鄉美食,只帶了兩位同事、其餘大部分是自發拍攝雷軍談小米澎程 N90 升頂探索版:4 年前理想 L9 爆火時開始討論設計,和後裝車頂帳篷相比感受差很遠雷軍:小米澎程系列 35 歲以上鎖單車主佔比 46%,增換購用戶佔比 80%雷軍回應小米澎程試駕客戶誤將油門當剎車:車主第二天就鎖單了,還感嘆通過性好
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。