直播“燒錢”後,羅福莉終於放出新模型,實測MiMo-V2.6系列:給小米汽車換個官網

2026年9月22日 10:22
站內 AI 整理稿

作者 | 畢偉豪 編輯|李水青 9月22日報道,今早,小米大模型團隊發佈並開源了新一代模型Xiaomi MiMo-V2.6系列,包含兩款原生全模態模型MiMo-V2.6-Pro與MiMo-V2.6-Flash,小米還將逐步開放MiMo-V2.6-Pro-UltraSpeed,相比MiMo-V2.6-Pro,同等智力水平輸出速度提高20倍。▲Xiaomi MiMo-V2.6系列模型官宣(來源:X) 此外,小米還同步開源了用於新模型訓練的RL環境和框架以及模型技術報告。▲Xiaomi MiMo-V2.6系列模型訓練框架(來源:Huggingface) 羅福莉早上發文稱,MiMo-V2.

6押注大規模RL擴展,進行了開源模型迄今最大規模的單次RL訓練,團隊將其視為探索RSI(遞歸自我改進)、通往AGI的新一步,她直言MiMo-V2.6的創新和工程難度已經超過了DeepSeek R1。▲羅福莉發文(來源:X) MiMo-V2.6-Pro在Artificial Analysis智能指數上取得46.32分,超過Kimi K3與Qwen3.8 Max,成為該榜單迄今得分最高的開源模型,不過從得分上看總體與頂尖開源模型差距不大,其得分與剛剛發佈的Grok 4.7相當。▲MiMo-V2.

6-Pro在Artificial Analysis智能指數排名(來源:Artificial Analysis) 在主要測試AI網頁開發能力的Code Arena WebDev榜單中,MiMo-V2.6-Pro首測拿下1628分,較上一代MiMo-V2.5-Pro的1475分大漲153分,目前排名全球前十、開源權重模型第三。▲MiMo-V2.6-Pro在Code Arena WebDev榜單排名(來源:Arena AI) 價格方面,MiMo-V2.6系列維持V2.5系列的API定價,MiMo-V2.6-Pro輸入(緩存命中)0.

025元/百萬tokens,緩存未命中3元/百萬tokens,輸出6元/百萬tokens;MiMo-V2.6-Flash輸入(緩存命中)0.02元/百萬tokens,緩存未命中1元/百萬tokens,輸出2元/百萬tokens;MiMo-V2.6-Pro-UltraSpeed定價是MiMo-V2.6-Pro的十倍。▲MiMo-V2.6系列模型定價(來源:小米) 有網友曬出MiMo-V2.6-Pro與Grok 4.7的價格對比,同等智力水平下,Grok 4.7的價格大約是MiMo-V2.6-Pro的29倍。▲網友評論(來源:X) Xiaomi MiMo-V2.

6系列發佈的預熱方式也非常有趣,9月17日凌晨,羅福莉在社交媒體上發佈了兩款模型的訓練數據實時看板,全網“直播”了小米MiMo-V2.6的訓練細節,兩輪訓練平均每小時燒掉了3.08w美元。▲羅福莉發文直播訓練過程(來源:X) 有網友評論稱這是有史以來最酷的開源發佈之一,不僅直播訓練過程,還開源了技術細節,性能超強的同時,定價低到離譜。▲網友評論(來源:X) 不過也有開發者對模型能力提出了質疑,認為MiMo-V2.6系列至少Flash模型沒有達到預期,在OpenCode中會不斷循環執行命令和讀取文件,執行能力較差。▲網友評論(來源:X) 第一時間在OpenCode中對MiMo-V2.

6系列模型進行了實測,從實際效果上看,MiMo-V2.6系列模型的多模態能力和編程水平尚可,但存在長時間思考和查找目錄文件等問題。一、6天30步75萬條軌跡:從Coding到3D、科研,持續探索RL擴展 羅福莉所說的大規模RL擴展,在MiMo-V2.6的技術報告裡以一串數字的形式呈現,為其6天的直播訓練過程中,MiMo-V2.6-Flash與MiMo-V2.6-Pro各自完成了30步,累計覆蓋約75萬條軌跡,對應訓練成本約85萬美元和262萬美元。經過這一輪訓練,兩款模型的訓練任務平均通過率分別提升25%和12%。在DeepSWE v1.1測試中,Flash從48.8分提升至65.

68分,Pro從58.4分提升至72.57分,分別增加約17分和14分。在RL訓練階段,MiMo-V2.6投入了大量算力,經過大規模、多任務強化學習訓練,MiMo-V2.6-Flash與MiMo-V2.6-Pro在多數Agent Benchmark上取得了接近Claude Opus5和GPT-5.6 Sol的分數。訓練系統方面,RL算力擴展主要體現在訓練規模、任務環境和基礎設施三個方面。小米採用全異步架構,單次更新1568個樣本,訓練最高支持100萬token上下文,每個RL step消耗約35億至37億token。

訓練任務也不再侷限於編程,而是覆蓋通用Agent、視覺和Cyber等場景,並混合多種Harness,讓不同任務產生的訓練信號能夠共同作用於模型。獎勵機制也進行了創新,對於長程RL任務,小米採用組內評分機制,將同一任務下不同軌跡的完成情況和質量放在一起比較,再重新分配獎勵信號。這樣既能區分“完成了任務”和“高質量完成任務”的差異,也能引導模型減少完成單個任務所需的路徑和token。隨著訓練規模擴大,穩定性問題也隨之出現,小米凍結了MoE Router,以減少訓練過程中的模型漂移;針對Reward hacking,則從獎勵設計、對抗評估到驗證器交叉校驗設置了多層防護。

在工程層面,小米還統一了軌跡表示和懲罰機制,並針對不同Agent框架進行高併發交互。在訓練規模擴大之後,MiMo-V2.6的能力覆蓋範圍也隨之擴展。新一代模型處理的任務已經從編程進一步延伸到3D內容、計算機操作、設計、視頻和音樂等場景。比如在3D遊戲開發任務中,模型可以接收一段視頻、一張圖片或一句提示詞,自行拆解任務,協調多個Agent搭建3D場景、實現交互邏輯,並根據渲染結果進行視覺檢查和迭代。▲MiMo-V2.6演示案例(來源:小米) 在Blender中,它還可以根據文本描述或參考圖片生成3D資產,並進一步將其用於動畫、3D打印和遊戲開發。▲MiMo-V2.

6演示案例(來源:小米) 通過Computer Use,MiMo-V2.6可以進入具身仿真環境。模型能夠接收多視角相機畫面,持續進行推理和決策,再通過視覺反饋控制Franka Panda機械臂,完成物體抓取、顏色匹配和精確放置。▲MiMo-V2.6演示案例(來源:小米) 設計類任務也在能力範圍之內,MiMo-V2.6可以生成完整的前端界面或演示文稿,其中包含版式結構、組件、交互元素和動效,並能夠與Figma以及圖像、視頻生成工具配合。▲MiMo-V2.6演示案例(來源:小米) MiMo-V2.

6系列模型還可以進行視頻製作,在小米展示的一支產品宣傳片中,從視覺設計、鏡頭與動效編排,到音樂創作和卡點剪輯,都由模型完成。▲MiMo-V2.6演示案例(來源:小米) 音樂是新增的能力,小米方面稱,MiMo-V2.6強化了音樂理解、審美判斷和樂理運用,並首次探索了作曲任務。▲MiMo-V2.6演示案例(來源:小米) 小米方面展示的科研案例進一步展現了通用能力的遷移。小米明確表示,這些科研任務並沒有經過專門的科研RL訓練,更多依靠模型已有的通用能力完成。材料科學方面,小米讓MiMo-V2.6-Pro設計一種用於吸附全氟和多氟烷基物質(PFAS)的全新金屬有機框架(MOF)。

在材料專家的引導下,模型完成網絡檢索、文獻與專利梳理、提出假設和新穎性評估,隨後調用開源計算工具搭建仿真環境,計算MOF與PFASs之間的結合強度,最終篩選出三種候選框架,再交由溼實驗進一步驗證。▲MiMo-V2.6演示案例(來源:小米) 數學方向則是對Li與Yorke經典論文《週期三蘊含混沌》中主定理進行Lean 4形式化。研究者設計探索策略後,MiMo-V2.6-Pro通過subagent協作推進定理陳述與證明,最終項目包含6000多行Lean代碼,並通過Lean內核完成完整驗證,沒有留下未完成的證明佔位符。▲MiMo-V2.

6演示案例(來源:小米) 二、賽車遊戲開發、小米汽車官方設計,容易長考,愛翻目錄 首先測試了一下基礎的多模態能力,輸入一張Hermes Agent應用的截圖,讓MiMo-V2.6-Pro不依賴工具進行識別,模型很快完成了讀圖任務,精準度不錯,但速度稍慢。同樣的提示詞,更換了模型和截圖,我們讓MiMo-V2.6-Flash來執行一下這項任務,能看到MiMo-V2.6-Flash僅用了6秒,但返還的結果在內容豐富程度上比Pro模型差很多。首先我們用一個網頁開發任務來對MiMo-V2.6-Flash的網絡搜索、文件操控和前端設計能力進行測試,讓MiMo-V2.

6-Flash自行搜索信息並開發一個小米汽車官網的Demo。在這項任務中,雖然我們給出的提示詞對網頁開發的要求非常高,但是MiMo-V2.6-Flash作為Flash級別模型,整體的開發時間還是過長,不過網頁開發的質量不錯,網頁的交互流暢程度以及圖片嵌入都不錯,比如下面這裡演示的預約試駕功能。不過美中不足的是,MiMo-V2.6-Flash開發的小米汽車官網,雖然文字部分都是小米汽車的性能參數,搜索並嵌入的圖片卻是奔馳、寶馬、奧迪。最後輸入了一個經典賽車遊戲開發提示詞,測試一下MiMo-V2.6-Pro的遊戲開發能力,提示詞如下: MiMo-V2.

6-Pro花了64分鐘完成了遊戲開發任務,開發出的遊戲效果存在不少問題,賽道本身不清晰,路徑沒有嚴格限制好,初始狀態下賽車的建模被埋在了下方,做得比較好的地方是遊戲操控感和整體的光影效果。此外,在測試MiMo-V2.6-Pro遊戲開發能力的時候,還輸入了一個3D世界遊戲開發的提示詞,在沒有專業遊戲開發工具依賴的情況下,MiMo-V2.6-Pro最終交付的3D世界本身的構建還是不錯的,功能、下落的雨絲以及人物動作都比較合理,僅存在雨傘不在手上的小問題。整體實測下來,MiMo-V2.6系列模型和上一代給我們的感受差不多——主打性價比。

模型基礎能力是不錯的,只是在思考時間上和執行任務的路線上存在一些問題,整體模型在任務交付效率上稍弱一些。當然,所做的實測都是基於OpenCode上所提供的模型進行的,不能代表模型小米官方Agent和API中的實際效果,也不能完全代表模型能力。結語:小米RSI道路新作,但模型能力仍需更多實測驗證 從這次發佈來看,MiMo-V2.6把重點放在了大規模RL訓練的進一步擴展上:6天完成30個RL step、覆蓋約75萬條軌跡,訓練任務也從Coding延伸到Agent、視覺、3D、Computer Use以及科研任務。

與此同時,小米將RL訓練環境、代碼和技術報告一併開源,把訓練過程中的基礎設施、獎勵機制等細節也公開出來。從Benchmark到實際測試,MiMo-V2.6展現出了較強的基礎能力,但不同任務之間仍存在明顯差異。尤其在長程任務中,模型的思考時間、工具調用和執行路徑都會直接影響最終交付效率,實測過程中的表現也存在很多問題。模型最終能走到什麼位置,除了榜單分數,後續實際使用中的任務完成質量和效率同樣重要。小米希望通過持續擴大RL訓練規模探索RSI,這條路線能否進一步提升模型的自主任務能力,還需要後續版本和更多實際任務來驗證。

Related

相關文章

鈦媒體生成式AI

Meta Muse 爆紅,為什麼騰訊股價大漲?

Meta Muse 爆紅,為什麼騰訊股價大漲?深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。9 月 8 日,Meta 推出個人 AI Agent Muse。上線不到兩週,Muse 登頂美國蘋果應用商店免費應用榜,排名超過 ChatGPT、Gemini 和 Claude。扎克伯格終於等來了一個消費級 AI 爆款。9 月 21 日,Meta 股價上漲 11.43%,創下 2025 年 4 月以來最大單日漲幅,市值一天增加約 1900 億美元。Muse 點燃的不只是 Meta。市場開始押注,個人 Agent 的普及會帶來更大的推理和計算需求。於是,Arm 上漲 17.2%,英特爾上漲 12.1%,AMD 上漲近 10%,市值首次突破 1 萬億美元。這輪行情很快傳到中國。9 月 22 日,騰訊控股盤中一度上漲 7.77%,股價升至 463.4 港元。在當天普遍上漲的港股科技股中,騰訊表現最突出。Muse 有什麼特別之處?它為什麼能讓華爾街重新相信扎克伯格,又為什麼讓遠在中國的騰訊獲得重估?為什麼說Muse是“社交+Agent”?從產品體驗看,Muse 完成表格填寫、日程整理、預訂餐廳、規劃旅行及購物等一系列任務。接到任務後,它會將目標拆解為多個步驟,再調用用戶已經授權的賬戶和服務。涉及發送郵件、提交訂單和付款等敏感操作時,Muse 會暫停執行,等待用戶再次確認。說實話,這些能力本身並不新鮮。OpenAI、Google、Anthropic,以及一批創業公司都有嘗試。Muse 的不同之處在於,Meta 第一次把個人 Agent 放進一個成熟的社交體系,嘗試藉助 Instagram、F

剛剛
鈦媒體生成式AI

Opus 5.5來了,性能趕超Fable,成本低至40%

Opus 5.5來了,性能趕超Fable,成本低至40%字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.5也已經排在後面,將在幾周後推出。某種意義上,Astra這腳油門踩下去,Anthropic連換代速度都被一起帶快了。和新模型同時到來的還有一個重置,正好方便用戶體驗。 Fable的定位有點尷尬了 既然被認為是衝著Astra來的,那就把它和Astra放在一起看。先說價格,Opus 5.5的API輸入價格是每百萬Token 4美元,輸出20美元;Astra則分別是10美元和50美元。也就是說,Opus 5.5的Token單價只有Astra的40%。兩款模型的上下文沒太大差別,Opus 5.5是100萬Token,Astra是105萬;最大輸出也都是128K Token。Astra的知識截止日期是2026年4月30日,Opus 5.5則更新到了2026年6月。兩款模型均支持low到max五檔推理強度。而且Opus 5.5相比自家上一代Opus 5也降價了。Opus 5原本是每百萬Token 5美元輸入、25美元輸出,新模型兩邊都降了20%;Anthropic稱,再加上Token使用效率提升,完成一項典型任務的實際成本能比Opus 5低約40%,輸出速度則提高了30%以上。便宜歸便宜,Opus 5.5在跑分上倒是一點沒客氣

剛剛
鈦媒體生成式AI

AI變天,Kimi怎麼補齊“月之暗面”?

光錐智能2026.09.23 10:15 · 來自廣西全文7430字00:00 / 20:20模型強只是入場券,月之暗面還需要補更多課文 | 光錐智能,作者|魏琳華,編輯|劉俊宏AI圈的規則就是用來打破的,市場變化之快,讓公司們經常猝不及防。

剛剛

​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰

據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。

剛剛
雷峰網生成式AI

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026

本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻!只靠語言和 token,AI 永遠跨不過物理世界這道門檻!作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。

剛剛