小米 MiMo-V2.6 發佈並開源:Pro 與 Flash 雙版本,API 價格與前代持平

2026年9月21日 07:05
小米 MiMo-V2.6 發佈並開源:Pro 與 Flash 雙版本,API 價格與前代持平
站內 AI 整理稿

作者:問舟 責編:問舟 評論: 感謝網友 浪系青年、Domado、DonaSarkar_、星落無影、失眠症、清朗的晨風、星河之夢、麵包加泡麵、自信的眉毛、DayDayUp 的線索投遞!9 月 22 日消息,小米今日凌晨正式發佈並開源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 與 Flash 兩個原生全模態模型。小米稱這是其探索 RSI(遞歸自我改進)路徑的關鍵一步,通過規模化擴展強化學習算力,讓模型在持續的探索與反饋中拓展智能邊界。得益於 RL 算力的擴展,MiMo-V2.

6-Pro 在 Artificial Analysis Intelligence Index(AA 綜合智能指數)v4.3.2 中取得 46 分,超過 Kimi K3(44 分)和 GLM-5.3(45 分),成為當前 AA 指數上排名最高的開源權重模型,較其前代 MiMo-V2.5-Pro 的 26 分高出 20 分。小米官方同時說明,該模型與 Claude Fable 5.1 和 GPT-6 Astra(均為 53 分)等頂級閉源模型相比仍有差距。在 RL 訓練階段,MiMo-V2.6 可能是目前國產開源模型中投入 RL 算力最多的模型之一。

Pro 與 Flash 訓練歷時不到 6 天,成本分別約 262 萬美元與 85 萬美元,各完成 30 步,累計約 75 萬條軌跡。訓練任務平均通過率分別相對提升 25% 和 12%,樣本外的長程軟件工程評測基準 DeepSWE v1.1 分別提升約 17 分(48.8 至 65.7)和約 14 分(58.4 至 72.6)。本次訓練從三個維度擴展 RL 算力:更大的 Batch 與更高吞吐,單次更新使用 1568 個樣本,支持 100 萬上下文長度訓練,單步訓練 Token 達 3.5 至 3.

7B;更多任務與複雜環境,構建覆蓋 Code、General、Visual、Cyber 等方向的多任務訓練體系;更大的 Grader 算力,通過 Group 內相對比較為長程 RL 任務提供更精準的獎勵信號。能力擴展上,MiMo-V2.6 融合了 3D 空間推理、多模態感知與計算機操作能力。在遊戲開發中,用戶輸入圖片、視頻或文字後,模型可將需求拆解為多個任務,由多智能體協作完成 3D 場景搭建、交互邏輯編寫與視覺驗證。在具身仿真環境中,MiMo-V2.6 可直接以多視角相機畫面為輸入,通過視覺反饋閉環控制 Franka Panda 機械臂,完成物體抓取、顏色匹配與精準放置。

注:全模態模型指可同時處理文本、圖像、視頻和音頻等多種輸入形式的模型。科研方面,MiMo-V2.6-Pro 協助研究人員完成了全氟和多氟烷基物質(PFAS)吸附用金屬有機框架(MOF)材料的設計方案篩選,並在 Lean 4 中完成了 Li-Yorke 經典論文《週期三蘊含混沌》原始主定理的完整形式化,形成 6000 餘行 Lean 源碼,完整證明通過 Lean 內核核驗。模型未接受過針對 Lean 的專項後訓練。MiMo-V2.6 系列沿用 V2.5 系列的 API 定價:Flash 為每百萬詞元輸入 1 元、每百萬輸出 2 元;Pro 為 3 元和 6 元,並提供 99% 緩存摺扣。

在同等智能水平下,價格僅為海外模型的 1/20 至 1/60。伴隨新模型發佈,MiMo Desktop 桌面客戶端(支持 Windows 與 Mac)及會員訂閱方案同步上線,訂閱會員即可使用 MiMo-V2.6-Pro 和 Flash 模型,也可配置自己的 API Key 使用客戶端。MiMo Desktop 同步上線 MiMo-V2.6-Pro 的 UltraSpeed 超高速模式,提供最高 20 倍的推理速度。MiMo-V2.6 系列已上線 Xiaomi MiMo 開放平臺。原邀測活動將在 1 周後結束,已獲得邀測資格的用戶切換模型名稱後方可繼續使用。同時,小米全面開源 MiMo-V2.

6-Pro、Flash 模型權重與技術報告,同步開放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究資源,分享經過驗證的訓練實踐,以下是詳細開源內容:7k+ 高質量 RL 任務環境:覆蓋軟件工程、漏洞復現、知識型工作、網頁設計開發四類智能體任務。以 MiMo-V2.6-Distill-Qwen-9B 為起點展開 RL 訓練,在 11 項評測中均較 SFT 基線取得提升:SWE-bench Verified 從 61.1 提升至 66.2,MiMo Cyber Bench 從 31.3 提升至 47.0,Terminal Bench 2.1 從 37.1 提升至 52.

8,MiMo Visual Coding 從 64.0 提升至 72.4;端到端 RL 訓練框架:基於 verl、uni-agent 和 mini-swe-agent,覆蓋環境交互、軌跡採集、獎勵評估與策略優化的完整訓練流程。結合開放的模型與任務環境,支持社區圍繞訓練算法、獎勵機制和 agent harness 開展研究與迭代;輕量可組合的 Harness:開源極簡 mini-harnesses,將系統提示、工具與上下文管理解耦,構建多樣且可控的訓練配置。

通過 Multi-Harness Training,能夠將多樣性和整潔性納入 RL 訓練,提升模型在不同框架、包括未見框架上的泛化能力,支持社區自由組合框架組件、拓展訓練配置,持續探索新的研究方向。廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:小米,開源大模型,MiMoV2.

6小米 69 元米家夜燈 4 開售:支持磁吸 / 懸掛 / 粘貼 + 8 個月長續航小米推出米家即熱飲水機 Pro:3 秒即熱出水,399 元小米雷軍回應“武漢街頭吃熱乾麵”爭議:幫助文旅宣傳家鄉美食,只帶了兩位同事、其餘大部分是自發拍攝雷軍談小米澎程 N90 升頂探索版:4 年前理想 L9 爆火時開始討論設計,和後裝車頂帳篷相比感受差很遠雷軍:小米澎程系列 35 歲以上鎖單車主佔比 46%,增換購用戶佔比 80%雷軍回應小米澎程試駕客戶誤將油門當剎車:車主第二天就鎖單了,還感嘆通過性好

Related

相關文章

智東西生成式AI

一文看懂昇騰超節點:AI Infra已進入系統工程階段

(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

3 小時前
鈦媒體生成式AI

Anew labs,“蒸餾”的行家

醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

6 小時前

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上

Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。

7 小時前