直播“燒錢”後,羅福莉終於放出新模型,實測MiMo-V2.6系列:給小米汽車換個官網
作者 | 畢偉豪 編輯|李水青 9月22日報道,今早,小米大模型團隊發佈並開源了新一代模型Xiaomi MiMo-V2.6系列,包含兩款原生全模態模型MiMo-V2.6-Pro與MiMo-V2.6-Flash,小米還將逐步開放MiMo-V2.6-Pro-UltraSpeed,相比MiMo-V2.6-Pro,同等智力水平輸出速度提高20倍。▲Xiaomi MiMo-V2.6系列模型官宣(來源:X) 此外,小米還同步開源了用於新模型訓練的RL環境和框架以及模型技術報告。▲Xiaomi MiMo-V2.6系列模型訓練框架(來源:Huggingface) 羅福莉早上發文稱,MiMo-V2.
6押注大規模RL擴展,進行了開源模型迄今最大規模的單次RL訓練,團隊將其視為探索RSI(遞歸自我改進)、通往AGI的新一步,她直言MiMo-V2.6的創新和工程難度已經超過了DeepSeek R1。▲羅福莉發文(來源:X) MiMo-V2.6-Pro在Artificial Analysis智能指數上取得46.32分,超過Kimi K3與Qwen3.8 Max,成為該榜單迄今得分最高的開源模型,不過從得分上看總體與頂尖開源模型差距不大,其得分與剛剛發佈的Grok 4.7相當。▲MiMo-V2.
6-Pro在Artificial Analysis智能指數排名(來源:Artificial Analysis) 在主要測試AI網頁開發能力的Code Arena WebDev榜單中,MiMo-V2.6-Pro首測拿下1628分,較上一代MiMo-V2.5-Pro的1475分大漲153分,目前排名全球前十、開源權重模型第三。▲MiMo-V2.6-Pro在Code Arena WebDev榜單排名(來源:Arena AI) 價格方面,MiMo-V2.6系列維持V2.5系列的API定價,MiMo-V2.6-Pro輸入(緩存命中)0.
025元/百萬tokens,緩存未命中3元/百萬tokens,輸出6元/百萬tokens;MiMo-V2.6-Flash輸入(緩存命中)0.02元/百萬tokens,緩存未命中1元/百萬tokens,輸出2元/百萬tokens;MiMo-V2.6-Pro-UltraSpeed定價是MiMo-V2.6-Pro的十倍。▲MiMo-V2.6系列模型定價(來源:小米) 有網友曬出MiMo-V2.6-Pro與Grok 4.7的價格對比,同等智力水平下,Grok 4.7的價格大約是MiMo-V2.6-Pro的29倍。▲網友評論(來源:X) Xiaomi MiMo-V2.
6系列發佈的預熱方式也非常有趣,9月17日凌晨,羅福莉在社交媒體上發佈了兩款模型的訓練數據實時看板,全網“直播”了小米MiMo-V2.6的訓練細節,兩輪訓練平均每小時燒掉了3.08w美元。▲羅福莉發文直播訓練過程(來源:X) 有網友評論稱這是有史以來最酷的開源發佈之一,不僅直播訓練過程,還開源了技術細節,性能超強的同時,定價低到離譜。▲網友評論(來源:X) 不過也有開發者對模型能力提出了質疑,認為MiMo-V2.6系列至少Flash模型沒有達到預期,在OpenCode中會不斷循環執行命令和讀取文件,執行能力較差。▲網友評論(來源:X) 第一時間在OpenCode中對MiMo-V2.
6系列模型進行了實測,從實際效果上看,MiMo-V2.6系列模型的多模態能力和編程水平尚可,但存在長時間思考和查找目錄文件等問題。一、6天30步75萬條軌跡:從Coding到3D、科研,持續探索RL擴展 羅福莉所說的大規模RL擴展,在MiMo-V2.6的技術報告裡以一串數字的形式呈現,為其6天的直播訓練過程中,MiMo-V2.6-Flash與MiMo-V2.6-Pro各自完成了30步,累計覆蓋約75萬條軌跡,對應訓練成本約85萬美元和262萬美元。經過這一輪訓練,兩款模型的訓練任務平均通過率分別提升25%和12%。在DeepSWE v1.1測試中,Flash從48.8分提升至65.
68分,Pro從58.4分提升至72.57分,分別增加約17分和14分。在RL訓練階段,MiMo-V2.6投入了大量算力,經過大規模、多任務強化學習訓練,MiMo-V2.6-Flash與MiMo-V2.6-Pro在多數Agent Benchmark上取得了接近Claude Opus5和GPT-5.6 Sol的分數。訓練系統方面,RL算力擴展主要體現在訓練規模、任務環境和基礎設施三個方面。小米採用全異步架構,單次更新1568個樣本,訓練最高支持100萬token上下文,每個RL step消耗約35億至37億token。
訓練任務也不再侷限於編程,而是覆蓋通用Agent、視覺和Cyber等場景,並混合多種Harness,讓不同任務產生的訓練信號能夠共同作用於模型。獎勵機制也進行了創新,對於長程RL任務,小米採用組內評分機制,將同一任務下不同軌跡的完成情況和質量放在一起比較,再重新分配獎勵信號。這樣既能區分“完成了任務”和“高質量完成任務”的差異,也能引導模型減少完成單個任務所需的路徑和token。隨著訓練規模擴大,穩定性問題也隨之出現,小米凍結了MoE Router,以減少訓練過程中的模型漂移;針對Reward hacking,則從獎勵設計、對抗評估到驗證器交叉校驗設置了多層防護。
在工程層面,小米還統一了軌跡表示和懲罰機制,並針對不同Agent框架進行高併發交互。在訓練規模擴大之後,MiMo-V2.6的能力覆蓋範圍也隨之擴展。新一代模型處理的任務已經從編程進一步延伸到3D內容、計算機操作、設計、視頻和音樂等場景。比如在3D遊戲開發任務中,模型可以接收一段視頻、一張圖片或一句提示詞,自行拆解任務,協調多個Agent搭建3D場景、實現交互邏輯,並根據渲染結果進行視覺檢查和迭代。▲MiMo-V2.6演示案例(來源:小米) 在Blender中,它還可以根據文本描述或參考圖片生成3D資產,並進一步將其用於動畫、3D打印和遊戲開發。▲MiMo-V2.
6演示案例(來源:小米) 通過Computer Use,MiMo-V2.6可以進入具身仿真環境。模型能夠接收多視角相機畫面,持續進行推理和決策,再通過視覺反饋控制Franka Panda機械臂,完成物體抓取、顏色匹配和精確放置。▲MiMo-V2.6演示案例(來源:小米) 設計類任務也在能力範圍之內,MiMo-V2.6可以生成完整的前端界面或演示文稿,其中包含版式結構、組件、交互元素和動效,並能夠與Figma以及圖像、視頻生成工具配合。▲MiMo-V2.6演示案例(來源:小米) MiMo-V2.
6系列模型還可以進行視頻製作,在小米展示的一支產品宣傳片中,從視覺設計、鏡頭與動效編排,到音樂創作和卡點剪輯,都由模型完成。▲MiMo-V2.6演示案例(來源:小米) 音樂是新增的能力,小米方面稱,MiMo-V2.6強化了音樂理解、審美判斷和樂理運用,並首次探索了作曲任務。▲MiMo-V2.6演示案例(來源:小米) 小米方面展示的科研案例進一步展現了通用能力的遷移。小米明確表示,這些科研任務並沒有經過專門的科研RL訓練,更多依靠模型已有的通用能力完成。材料科學方面,小米讓MiMo-V2.6-Pro設計一種用於吸附全氟和多氟烷基物質(PFAS)的全新金屬有機框架(MOF)。
在材料專家的引導下,模型完成網絡檢索、文獻與專利梳理、提出假設和新穎性評估,隨後調用開源計算工具搭建仿真環境,計算MOF與PFASs之間的結合強度,最終篩選出三種候選框架,再交由溼實驗進一步驗證。▲MiMo-V2.6演示案例(來源:小米) 數學方向則是對Li與Yorke經典論文《週期三蘊含混沌》中主定理進行Lean 4形式化。研究者設計探索策略後,MiMo-V2.6-Pro通過subagent協作推進定理陳述與證明,最終項目包含6000多行Lean代碼,並通過Lean內核完成完整驗證,沒有留下未完成的證明佔位符。▲MiMo-V2.
6演示案例(來源:小米) 二、賽車遊戲開發、小米汽車官方設計,容易長考,愛翻目錄 首先測試了一下基礎的多模態能力,輸入一張Hermes Agent應用的截圖,讓MiMo-V2.6-Pro不依賴工具進行識別,模型很快完成了讀圖任務,精準度不錯,但速度稍慢。同樣的提示詞,更換了模型和截圖,我們讓MiMo-V2.6-Flash來執行一下這項任務,能看到MiMo-V2.6-Flash僅用了6秒,但返還的結果在內容豐富程度上比Pro模型差很多。首先我們用一個網頁開發任務來對MiMo-V2.6-Flash的網絡搜索、文件操控和前端設計能力進行測試,讓MiMo-V2.
6-Flash自行搜索信息並開發一個小米汽車官網的Demo。在這項任務中,雖然我們給出的提示詞對網頁開發的要求非常高,但是MiMo-V2.6-Flash作為Flash級別模型,整體的開發時間還是過長,不過網頁開發的質量不錯,網頁的交互流暢程度以及圖片嵌入都不錯,比如下面這裡演示的預約試駕功能。不過美中不足的是,MiMo-V2.6-Flash開發的小米汽車官網,雖然文字部分都是小米汽車的性能參數,搜索並嵌入的圖片卻是奔馳、寶馬、奧迪。最後輸入了一個經典賽車遊戲開發提示詞,測試一下MiMo-V2.6-Pro的遊戲開發能力,提示詞如下: MiMo-V2.
6-Pro花了64分鐘完成了遊戲開發任務,開發出的遊戲效果存在不少問題,賽道本身不清晰,路徑沒有嚴格限制好,初始狀態下賽車的建模被埋在了下方,做得比較好的地方是遊戲操控感和整體的光影效果。此外,在測試MiMo-V2.6-Pro遊戲開發能力的時候,還輸入了一個3D世界遊戲開發的提示詞,在沒有專業遊戲開發工具依賴的情況下,MiMo-V2.6-Pro最終交付的3D世界本身的構建還是不錯的,功能、下落的雨絲以及人物動作都比較合理,僅存在雨傘不在手上的小問題。整體實測下來,MiMo-V2.6系列模型和上一代給我們的感受差不多——主打性價比。
模型基礎能力是不錯的,只是在思考時間上和執行任務的路線上存在一些問題,整體模型在任務交付效率上稍弱一些。當然,所做的實測都是基於OpenCode上所提供的模型進行的,不能代表模型小米官方Agent和API中的實際效果,也不能完全代表模型能力。結語:小米RSI道路新作,但模型能力仍需更多實測驗證 從這次發佈來看,MiMo-V2.6把重點放在了大規模RL訓練的進一步擴展上:6天完成30個RL step、覆蓋約75萬條軌跡,訓練任務也從Coding延伸到Agent、視覺、3D、Computer Use以及科研任務。
與此同時,小米將RL訓練環境、代碼和技術報告一併開源,把訓練過程中的基礎設施、獎勵機制等細節也公開出來。從Benchmark到實際測試,MiMo-V2.6展現出了較強的基礎能力,但不同任務之間仍存在明顯差異。尤其在長程任務中,模型的思考時間、工具調用和執行路徑都會直接影響最終交付效率,實測過程中的表現也存在很多問題。模型最終能走到什麼位置,除了榜單分數,後續實際使用中的任務完成質量和效率同樣重要。小米希望通過持續擴大RL訓練規模探索RSI,這條路線能否進一步提升模型的自主任務能力,還需要後續版本和更多實際任務來驗證。
Related
相關文章

韶音首款 AI 耳機 OpenFit 2 AI 亮相雲棲大會,重磅首發“AI 實驗室”四大新功能
作為開放式耳機領域的領頭羊,Shokz 韶音首次重磅參展,不僅攜旗下首款 AI 耳機 OpenFit2AI 核心亮相,更在現場聯合光帆科技首發了“AI 實驗室”全新功能,全面展現了 Qwen 大模型在音頻可穿戴設備中的深度產業落地。作為韶音佈局智能音頻賽道的開山之作,OpenFit2AI 深度融合了通義千問(Qwen)大模型的強大能力,集長時錄音、AI 會議紀要生成與多語種實時翻譯於一體。

GPT-6 Sol和Luna上線,打折比梁文鋒還狠
字母AI2026.09.23 11:08 · 來自北京全文5453字00:00 / 14:27Opus 5.5發佈90分鐘,OpenAI來打價格戰了。文 | 字母AI今夜註定無眠。Opus 5.5剛剛發佈90分鐘,OpenAI就把GPT-6 Sol和Luna一起端了上來。前腳Anthropic剛把Opus的價格砍了一刀,後腳OpenAI直接把刀砍得更深。GPT-6 Sol每百萬Token輸入只要2美元、輸出10美元,價格正好只有Opus 5.5的一半,Astra的五分之一。Luna更誇張,只要0.1美元和0.

Claude Code v2.1. 280 落地:Opus 5. 5 正式接棒默認王座,百萬上下文配 4 美元骨折價把賬單壓進地心
最新推送的Claude Code v2.1.280版本里,Claude Opus5.5(claude-opus-5-5)正式被任命為默認Opus模型,這也讓前陣子開發者圈裡流傳的"跳級突襲"傳聞徹底塵埃落定。這枚新旗艦一口氣吞下100萬Token的上下文窗口,定價牌掛得異常兇悍:每百萬Token輸入4美元、輸出20美元,緩存讀取更是壓到每百萬Token0.

Meta Muse 爆紅,為什麼騰訊股價大漲?
深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。

Opus 5.5來了,性能趕超Fable,成本低至40%
字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.

OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌
正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日核實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。