羅福莉押注大規模RL、小米最強開源模型亮相:6天燒掉2000多萬,多個 Agent 基準比肩閉源旗艦

AI前線·2026年09月22日 15:23模型介紹、技術實現細節、 實測案例都在這裡了。9 月 22 日,小米 MiMo 團隊發佈並開源 MiMo-V2.6 系列,包括旗艦模型 MiMo-V2.6-Pro 和側重效率與成本的 MiMo-V2.6-Flash。與此同時,小米還推出了面向低延遲場景的 MiMo-V2.6-Pro-UltraSpeed,官方稱其在保持相同模型質量的情況下,輸出速度最高可達到標準 Pro 版本的 20 倍。小米新發系列旗艦模型 與單純擴大模型參數不同,MiMo-V2.6 此次強調的是強化學習階段的計算擴展。
小米將其描述為探索 RSI(Recursive Self-Improvement,遞歸自我改進)路徑的一次嘗試:在編程、通用智能體、視覺任務和網絡安全等具有可驗證結果的複雜環境中增加強化學習投入,讓模型通過反覆探索、環境反饋和結果評估改善任務完成能力。不過,從目前披露的信息來看,MiMo-V2.6 所體現的“自我改進”,主要發生在由訓練系統、任務環境和評估器共同組成的強化學習閉環中,尚不意味著模型已經能夠脫離人類設計的訓練框架,自主修改自身架構或啟動下一輪訓練。據介紹,MiMo-V2.6-Pro 和 MiMo-V2.
6-Flash 均採用稀疏混合專家架構,並原生支持文本、圖像、視頻和音頻輸入,最長上下文窗口為 100 萬 Token。其中,MiMo-V2.6-Pro 擁有 1.02 萬億總參數,每次推理激活約 420 億參數;MiMo-V2.6-Flash 總參數為 3090 億,激活參數約為 150 億。兩款模型使用相同的視覺和音頻編碼器,並配置五層多 Token 預測模塊,用於推測式解碼。從定位上看,Pro 面向複雜編程、長程智能體和研究任務,Flash 則試圖以更少的激活參數降低推理成本。兩款模型的權重已在 Hugging Face 上以 MIT 許可證發佈。MiMo-V2.
6 系列還包含一款由 Qwen 架構蒸餾而來的 90 億參數模型,但小米此次的主要產品仍是 Pro 和 Flash 兩個版本。Hugging Face 的模型集合目前共收錄三款 MiMo-V2.6 模型。模型發佈後,小米大模型負責人、前 DeepSeek 研究員羅福莉在 x 上發帖將 MiMo-V2.6 的研發過程概括為“一條艱難的強化學習擴展之路”。她表示,按計算投入衡量,MiMo-V2.6“很可能是迄今開源模型團隊開展的最大規模單次強化學習訓練之一”。在算力資源仍然非常緊張的情況下,小米依然選擇投入數十人的團隊,集中完成這一次大規模 RL 訓練。Benchmark 表現如何?
那麼,這系列模型的基準測試表現怎樣?根據小米公佈的測試結果,MiMo-V2.6-Pro 在 DeepSWE v1.1 上取得 71.9 分,明顯高於上一代 MiMo-V2.5-Pro 的 19 分;Flash 為 67.9 分。在 Terminal Bench 2.1 上,兩款模型分別為 89.9 分和 87.6 分。通用智能體測試中,Pro 在 AutomationBench v1.0.6 上獲得 53.1 分,高於對比表中的 Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5;Flash 為 52.3 分。
在 OSWorld-Verified 上,兩款模型分別取得 82 分和 80.8 分。但這些結果也顯示,MiMo-V2.6 並未在所有項目上領先。Pro 在 ProgramBench 上取得 26.5 分,低於 Claude Opus 5 的 37 分;Terminal Bench 4.0 得分 34.9,低於 Claude Opus 5 的 49 分。在 Toolathlon-Verified、GDPval-AA 2.1 等測試中,Pro 也不是最高得分模型。小米還引用 Artificial Analysis Intelligence Index v4.3 的結果稱,MiMo-V2.
6-Pro 得分為 46.32,並將其描述為當前得分最高的開源模型。此次發佈,MiMo-V2.6 值得關注的一個點是,小米開始嘗試把編程能力擴展到更廣泛的生產任務。基準測試結果看起來很強大,實際應用效果如何?小米給我了幾組官方案例。在官方展示的案例中,模型可以根據文本、圖片或視頻描述,將遊戲開發任務拆解給多個智能體,分別完成 3D 場景構建、交互邏輯編寫和視覺驗證,並根據渲染結果反覆修改。小米將這種由自然語言驅動、從軟件開發延伸至交互式世界構建的方式稱為“Vibe World”。
在 3D 建模場景中,模型可以控制 Blender,根據文字或參考圖片生成物體和場景;再比如在具身仿真環境中,模型可以讀取多路攝像頭畫面,通過視覺反饋控制 Franka Panda 機械臂,完成抓取、顏色匹配和物體放置。MiMo-V2.6 還展示了前端頁面、演示文稿、視頻剪輯和音樂創作能力。例如,MiMo-V2.6 可提供端到端的高質量視頻創作服務。對於創意和產品宣傳視頻,它可以根據用戶需求處理視覺設計、鏡頭和動態序列、音樂創作以及節拍同步剪輯。對於教育視頻,它可以將傅里葉分解等抽象概念轉化為通俗易懂的解釋和連貫的動畫,並利用 MiMo-V2.5-TTS 生成與畫面精準同步的旁白。
這實現了從概念分解到最終視頻輸出的全流程自動化,將複雜的知識轉化為觀眾易於理解的生動內容。這些案例反映出 MiMo-V2.6 的目標不只是生成代碼,而是讓代碼、視覺理解、工具調用和計算機操作共同服務於一個完整任務。此外,小米還公佈了兩個科研案例。第一個案例涉及材料研究。小米材料專家要求 MiMo-V2.6-Pro 設計一種能夠吸附全氟和多氟烷基物質的金屬有機框架材料。模型完成了文獻及專利檢索、假設提出、創新性分析,並調用開源計算工具開展模擬,計算不同材料與目標物質之間的結合強度,篩選進入溼實驗階段的候選結構。第二個案例是形式化數學證明。
在研究人員設計的探索策略和多智能體協作流程下,MiMo-V2.6-Pro 參與完成了經典論文《週期三意味著混沌》主要定理的 Lean 4 形式化。最終項目包含超過 6000 行 Lean 代碼,並通過 Lean 內核驗證,沒有保留未完成的證明佔位符。但需要注意的是,這些工作均不是模型獨立完成:材料案例由專業人員經過多輪提示和篩選推進,數學案例同樣依賴研究人員設計探索策略,並進行了後續修訂與整合。因此,從這個角度來看,它們更能說明模型作為科研輔助工具的潛力,而不是證明模型已經具備自主開展科研的能力。6 天完成約 150 萬條軌跡, 強化學習成本超過 340 萬美元 MiMo-V2.
6 最值得關注的變化並不是參數規模,而是強化學習訓練方式。有意思的是,在正式發佈 MiMo-V2.6 之前,小米 MiMo 團隊曾將這輪強化學習的生產訓練過程公開直播,對外展示兩款模型的訓練進度、任務得分和資源消耗。與發佈模型後再披露結果不同,這次直播把一場持續近 6 天的大規模 RL 訓練直接擺到外界面前:模型是否持續提升、訓練中途是否出現波動,以及算力投入能否換來能力增長,都可以從實時曲線中觀察。如今隨著模型與技術報告發布,這場直播背後的訓練規模和技術細節也進一步浮出水面。小米披露,MiMo-V2.6-Pro 和 MiMo-V2.
6-Flash 分別在不到 6 天的時間內完成 30 個強化學習步驟,每款模型處理約 75 萬條軌跡。Flash 的訓練成本約為 85 萬美元,Pro 約為 262 萬美元,合計約 347 萬美元。其單步訓練批次包含 1568 個提示,每個提示生成 16 條軌跡,單步處理約 35 億至 37 億 Token,訓練上下文最高達到 100 萬 Token。與分別針對編程、視覺或智能體進行獨立強化學習不同,小米將編程、通用智能體、視覺和網絡安全任務混合在同一輪訓練中,希望不同任務中形成的策略能夠互相遷移。
在獎勵環節,MiMo 團隊沒有僅使用“通過或失敗”的二元信號,而是引入組內比較機制:評估智能體對同一道任務產生的多條軌跡進行橫向比較,為已經完成任務的方案進一步區分質量,並將更高獎勵分配給路徑更短、Token 消耗更少或執行質量更高的結果。這套方法的直接目的,是解決長程智能體訓練中的一個問題:兩條軌跡可能都通過測試,但它們在執行效率、步驟合理性和穩定性方面存在明顯差異,僅靠最終測試結果無法體現這種差別。為了控制獎勵作弊,小米稱其在訓練中加入了環境加固、異常檢測、對抗性評估及不同驗證器之間的交叉檢查,並凍結了 MoE 模型的路由器,以減少大規模強化學習過程中專家選擇策略發生漂移。
按照官方公佈的訓練曲線,經過 30 步強化學習後,Flash 和 Pro 在訓練任務上的平均通過率分別相對提高約 25%和 12%。在未直接用於訓練的長程軟件工程測試 DeepSWE v1.1 上,兩款模型分別從 48.8 分和 58.4 分提升到 65.68 分和 72.57 分。小米據此認為,強化學習帶來的提升能夠部分遷移到訓練分佈之外。小米同時開放了技術報告、訓練環境和強化學習代碼。相比只發布最終權重,這使外界有機會進一步檢查其任務設置、獎勵設計與訓練過程,但相關結果能否被獨立復現,仍有待開發者和研究機構後續驗證。MiMo-V2.6 提升如此快,技術上如何實現的?
從技術報告看,MiMo-V2.6 的性能並不是由某個單點創新帶來的,是模型架構、預訓練、中期訓練、強化學習規模、獎勵設計和訓練基礎設施共同作用的結果。其中最關鍵的變化,是小米不再只把計算資源用於增加預訓練數據和模型參數,而是將大量算力投入模型與真實任務環境的交互,讓模型在一次次執行、驗證和糾錯中學習如何完成長程任務。簡單來說,MiMo-V2.6 的路線可以概括為:先用大規模預訓練建立知識和多模態理解能力,再通過面向智能體的中期訓練擴展模型的“探索空間”,最後在可驗證的複雜任務上大規模生成軌跡,利用更精細的獎勵機制篩選出更好的解決路徑。
第一層:混合注意力與稀疏 MoE 兼顧規模和長上下文 MiMo-V2.6-Pro 採用稀疏混合專家架構,總參數為 1.02 萬億,每次推理激活約 420 億參數。Flash 總參數約 3100 億,激活約 150 億參數。兩款模型每層只激活 8 個專家,由此在擴大模型容量的同時,避免讓全部參數參與每一次計算。模型主幹採用“滑動窗口注意力+全局注意力”交替排列的混合架構。滑動窗口注意力只處理附近 Token,將計算開銷控制在較低水平;週期性插入的全局注意力,則負責重新彙總長距離信息。
這種設計針對的是長程智能體任務中的現實矛盾:模型需要讀取代碼庫、工具返回結果、歷史操作和多輪上下文,但如果每一層都對全部 Token 執行全局注意力,100 萬 Token 上下文的計算和顯存成本會非常高。MiMo-V2.6-Pro 共包含 70 層,其中 60 層使用滑動窗口注意力,10 層使用全局注意力;Flash 共 48 層,其中 39 層為滑動窗口注意力、9 層為全局注意力。其滑動窗口大小為 128 個 Token。這使模型可以用大量局部計算處理細節,再由少數全局注意力層完成跨區域信息交換。
它並不會消除長上下文的計算成本,但相比全程使用全局注意力,更適合處理代碼倉庫和長時間智能體軌跡。視覺編碼器也採用了類似思路。MiMo-ViT 在局部滑動窗口層中交替使用行優先和列優先的 Token 排列,讓視覺信息能夠分別沿水平和垂直方向傳播,再通過週期性的全局注意力聚合完整畫面。官方稱,該視覺編碼器使用超過 4 萬億個圖像 Token 預訓練。音頻部分則先把音頻轉換成離散 Token,再把連續四幀合併成一個音頻 Patch,將輸入主模型的音頻序列頻率從每秒 25 個降至 6.25 個,以縮短序列長度。
因此,所謂“原生全模態”並不是簡單地把多個獨立模型串聯起來,而是將文字、圖像、視頻和音頻編碼為統一序列,交給同一套語言模型主幹處理。MiMo-V2.6 的模型卡顯示,兩款模型均支持四種模態及 100 萬 Token 上下文。第二層:預訓練之後,先進行一次面向智能體的“中期訓練” 技術報告披露,MiMo-V2.6 採用兩階段預訓練。第一階段只訓練語言模型主幹,數據包括公開網頁、書籍、學術論文、代碼和 STEM 材料;第二階段接入視覺與音頻編碼器,在圖文、OCR、GUI、視頻、視覺編程、語音識別和音頻描述等數據上聯合訓練。MiMo-V2.
6-Flash 的預訓練數據量為 48 萬億 Token,其中純文本階段 26 萬億 Token,全模態階段 22 萬億 Token;Pro 共訓練 30 萬億 Token,其中 270 億——更準確地說是 27 萬億——來自文本階段,3 萬億來自全模態階段。預訓練時,模型上下文窗口從 3.2 萬 Token 逐步擴展到 25.6 萬 Token。此後,小米的做法是增加了一個面向智能體的中期訓練階段。這一階段的數據不僅包括高質量文本、代碼、圖像和音視頻,也包括編程、通用智能體、視覺與科研場景中的真實任務軌跡。模型先在 25.
6 萬 Token 上下文上訓練,最後再擴展至 100 萬 Token。技術報告對這一步的解釋是:預訓練提供知識,中期訓練則在預訓練與大規模強化學習之間建立橋樑,讓模型提前接觸“觀察環境—調用工具—讀取結果—繼續行動”的任務形式。如果沒有這一階段,模型雖然可能掌握大量知識,卻未必能夠在強化學習開始時有效探索。大量軌跡可能消耗在格式錯誤、工具調用失敗或者無法維持長程上下文等基礎問題上。小米還在中期訓練階段將部分參數的優化器從 AdamW 切換到 Muown。傳統 AdamW 按參數元素調整更新幅度;Muown 則利用權重矩陣的結構,對更新矩陣進行正交化處理。
小米認為,在超大批次訓練中,這種方式能夠維持更好的數據效率。模型同時接受 MXFP4 量化感知訓練,使其在訓練期間提前適應低精度計算,為後續 FP4 推理減少質量損失。第三層:一次強化學習生成 2.5 萬條軌跡 MiMo-V2.6 性能提升最直接的來源,是強化學習規模的大幅擴張。小米在每個強化學習步驟中抽取 1568 個任務,每個任務生成 16 種候選解法,也就是一次產生約 2.5 萬條智能體軌跡。這些軌跡合計包含 27 億至 37 億個訓練 Token,平均每條約 11 萬至 15 萬個 Token。這和普通問答式強化學習存在明顯區別。MiMo-V2.
6 面對的不是一道題、一段回答,是持續數十步甚至更長的智能體任務。一條軌跡可能包括: • 閱讀代碼倉庫; • 檢索相關文件; • 修改代碼; • 運行測試; • 根據報錯繼續修改; • 調用外部工具; • 最終提交結果。MiMo-V2.6-Pro 和 Flash 均完成 30 個強化學習步驟,分別處理約 75 萬條軌跡。Pro 的強化學習成本約為 260 萬美元,Flash 約為 90 萬美元。在 Pro 的強化學習支出中,約 43.8%用於模型生成軌跡,43.5%用於參數訓練,還有 12.7%用於評估器。換句話說,小米投入的計算資源不只是讓模型“多做題”,還用於判斷不同答案究竟好在哪裡。
根據報告,在這輪強化學習中,Pro 在 DeepSWE v1.1 上的平均成績由 58.4 分提升至 72.6 分,Flash 由 48.7 分提升至 65.7 分。性能隨著累計強化學習投入總體上升,但訓練過程中也存在波動。這組數據支持“增加 RL 計算可以繼續釋放模型潛力”的判斷,但還不能證明性能會隨投入無限增長。報告只展示了 30 步訓練範圍內的變化,沒有給出繼續擴大至數倍計算量後的收益曲線。第四層:不再只判斷“做對沒有”,還要判斷“做得好不好” 傳統代碼強化學習經常使用二元獎勵:測試通過記為 1,失敗記為 0。
這種方式容易規模化,但存在一個問題:兩份代碼都通過了測試,不代表它們的質量相同。一份可能只修改必要代碼,另一份可能加入大量無關邏輯;一份真正定位了問題,另一份可能通過硬編碼或利用測試漏洞獲得正確結果。MiMo-V2.6 引入了兩套組內智能體評估機制。第一套是 Groupwise Reward Synthesis,即組內獎勵合成。小米先針對同一任務生成多種解決方案,讓評估智能體比較這些方案,並建立兩類評分標準: • 解決方案標準:是否完整滿足需求、是否覆蓋邊界情況、代碼修改是否符合原有項目結構; • 行為標準:模型是否收集了必要證據、是否檢查代碼改動、是否驗證最終結果。
訓練時,測試結果、解決方案質量和執行行為三部分相乘。未通過測試的軌跡仍然得不到獎勵;通過測試的軌跡則根據實現質量進一步區分。第二套是 Groupwise Advantage Redistribution,即組內優勢重分配。對於同一任務產生的 16 條軌跡,評估器會把成功和失敗方案放在一起比較,並從解決思路、實現完整性、修改範圍、副作用和代碼規範等維度對通過測試的方案排序。隨後,訓練系統會從質量較低的正確答案中移走一部分正向獎勵,重新分配給質量更高的方案。它解決的不是“模型能否得到正確答案”,而是“模型能否用更穩定、更簡潔、更符合工程規範的方式得到答案”。
技術報告顯示,加入在線組內評估後,模型在 DeepSWE 上的通過率能夠繼續增長;缺少這套機制時,後期提升更容易趨於停滯。第五層:同時訓練多個領域和多套 Agent 框架 MiMo-V2.6 沒有為代碼、視覺和工具調用分別執行獨立強化學習,而是在同一次訓練中混合多類任務。其強化學習數據大致由以下部分構成: • 智能體編程和競技編程:68%; • 通用工具調用:12%; • 視覺與審美設計:13%; • 上下文遵循:3%; • 網絡安全:4%。代碼任務又同時運行在多種 Agent Harness 上。
Harness 可以理解為包裹模型的執行框架,它決定模型能使用哪些工具、如何獲得上下文、怎樣編輯文件以及如何提交結果。如果訓練始終使用同一套框架,模型可能學會適應該框架的提示詞和工具習慣,卻無法遷移至其他 Agent 產品。為減少這類過擬合,小米在訓練中使用四套輕量級 Harness,並在 Codex、Claude Code 和 mini-swe-agent 三套未參加訓練的 Harness 上測試。報告顯示,三套留出框架的 DeepSWE 平均 Pass@1 從約 50%提高到 66%,說明模型學到的部分能力能夠跨 Harness 遷移,而不只是記住某一種執行流程。
這也是多任務強化學習的一個重要作用:模型需要學習更通用的任務分解、工具選擇和錯誤恢復策略,而不是依賴固定的提示模板。第六層:凍結 MoE 路由器,避免專家系統在強化學習中失衡 大規模 MoE 模型進行強化學習時,還會遇到一個容易被忽視的問題:專家負載可能逐漸失衡。如果路由器繼續參與訓練,模型可能越來越頻繁地把 Token 分給少數專家,導致部分專家過載,另一些專家幾乎不再被調用。這樣不僅影響模型能力,也會造成通信和顯存瓶頸。小米發現,在允許路由器更新的實驗中,專家負載的變異係數從 0.78 升至 2.0,負載最高的專家從平均值的 6 倍升至 16 倍,低負載專家佔比則由 0.
5%增加到 22%。研究人員隨後恢復了訓練前的路由參數,專家負載立即恢復,但模型測試成績基本不變。這說明問題主要來自路由器漂移,而不是專家權重本身退化。因此,小米在正式強化學習中凍結了 MoE 路由器,只訓練其他參數。凍結後,專家負載指標基本保持穩定,而模型能力仍然繼續上升。這一設計本身不會直接提高基準成績,但它保證了 1.02 萬億參數模型能夠在大規模強化學習中穩定訓練,是性能提升能夠持續發生的基礎條件。第七層:用 MOPD²補齊難以驗證的開放任務 編程任務之所以適合強化學習,是因為代碼能否通過測試相對容易驗證。但遊戲開發、科學研究、具身智能和開放式設計很難找到一個可靠的二元評估器。
MiMo-V2.6 在混合強化學習之後,又使用了 MOPD²,即多前綴、多教師在策略蒸餾。它首先訓練多個領域教師模型,再讓學生模型從教師軌跡或高質量示範中的不同中間節點繼續生成。教師模型不要求學生從頭複製整條軌跡,而是在每個關鍵決策點,對學生新生成的下一步提供 Token 級監督。這樣做有兩個好處: 一是可以把不同領域教師的能力彙總到同一個模型中;二是避免每次都從頭重新執行漫長軌跡,降低蒸餾成本。對於缺乏可靠獎勵的開放任務,小米先利用高質量合成數據訓練監督微調教師,再從這些示範軌跡的中間狀態啟動學生模型。這讓強化學習獲得的代碼和智能體能力,可以進一步擴展到遊戲開發、科研及具身智能等場景。
目前,MiMo-V2.6-Pro 和 Flash 已接入小米 AI Studio、MiMo Code、MiMo Desktop、MiMo API 平臺和 OpenRouter。其中,MiMo Desktop 此次結束早期測試,推出首個正式版本。小米表示,Pro 和 Flash 的 API 價格維持 V2.5 系列的標準。按每百萬 Token 計算: UltraSpeed 的輸入和輸出單價均為普通 Pro 版本的 10 倍,換取最高 20 倍的輸出速度。由此看,這一版本主要面向實時交互、編程輔助或其他對響應延遲敏感的工作流,而非以最低 Token 成本為目標的大規模離線任務。
實測:很驚豔,但也有幻覺 模型發佈後,為了進一步瞭解 MiMo-V2.6 Pro 的實際表現,AI 前線對模型進行了一輪多模態測試,分別考察其圖像識別與 OCR、視頻時序理解、音頻轉寫與全模態長任務等能力。測試不僅關注模型能否識別和概括內容,也重點觀察其能否在不同模態之間建立對應關係、準確定位信息來源、識別材料衝突,並在證據不足時避免自行補全或給出過度確定的結論。測試一:圖片理解:OCR、空間關係與細節推理 為了測試模型的圖片理解能力,AI 前線上傳了一張信息密度較高的真實圖片,這是前陣子在螞蟻外灘大會現場拍攝的一位 keynote 演講嘉賓的 PPT 照片。
然後給出的提示詞如下: 請分析這張圖片,完成以下任務: 1、準確提取圖片中的標題、關鍵數字、單位和註釋; 2、描述主要元素之間的空間位置和對應關係; 3、總結這張圖試圖表達的核心結論; 4、指出至少兩處容易被誤讀的細節; 我們想重點觀察是否抄錯數字、單位和模型名稱;能否理解圖例與曲線的對應關係;是否把推測寫成事實。輸出結果如下: 1.標題、關鍵數字、單位和註釋 • 主標題:“為什麼 AI 還沒有 1000 倍的加速科學發現?
” • 副標題(核心論點):科學發現的瓶頸,在於驗證(Verification),在於可追溯(Traceability),可重複(Reproducibility) • 會議標識:inclusion CONFERENCE ON THE BUND 外灘大會 • 左側欄目標題:大量科學實驗不可重複、無法追溯、難以驗證,下方引述“Nature 調查顯示”,列出三條:70%的科學實驗無法重現;50%的實驗結果連作者本人都無法重現;當驗證變成搖骰子,尋找新發現就變成了盲人摸象 • 右側圖表標題:HAVE YOU FAILED TO REPRODUCE AN EXPERIMENT?(你是否未能復現某個實驗?
) • 圖表註釋:Most scientists have experienced failure to reproduce results.(大多數科學家都經歷過無法復現結果的情況) • 圖例:Someone else's(他人實驗)、My own(自己的實驗) • 關鍵數字與單位:70%、50%、1000 倍;圖表橫軸單位為百分比(0—100%,刻度間隔 20%) • 圖表各學科條形數值:內容中未標註精確數值,只能從座標軸目測估算,見下方表格(標註為約值)。2.
主要元素的空間位置與對應關係 • 畫面頂部為會議名稱標識(右上角為 inclusion 外灘大會 Logo),主標題橫貫上部,副標題緊隨其下,起到統領全圖的作用。• 畫面左中部為紫色圓角文本框:左上角配有對話氣泡圖標,框內自上而下依次是結論句、“Nature 調查顯示”引語、三條要點,是對副標題"驗證/可追溯/可重複瓶頸的論據支撐。• 畫面右中部為橫向條形圖,與左側文本框左右並列,二者是“文字論點(左)+數據證據(右)”的對應關係:左框中的“70%”“50%”與右側圖表同屬實驗不可復現這一主題,圖表按學科細分佐證左側總括性結論。
• 圖表內部:縱向為學科類別(Chemistry、Biology、Physics and engineering、Medicine、Earth and environment、Other),每個學科對應兩根條形(紅色=Someone else's,淺紅=My own),橫軸為百分比。• 畫面左下角為演講者,底部為聽眾席剪影,屬於現場場景元素,與圖表內容無數據對應關係。3.
核心結論 這張圖試圖表達:AI 尚未帶來“1000 倍”的科學發現加速,瓶頸不在提出想法,而在於驗證(Verification)、可追溯(Traceability)、可重複(Reproducibility)——大量科學實驗不可重複、無法追溯、難以驗證。據 Nature 調查,70%的科學實驗無法重現,50%的實驗結果連作者本人都無法重現;正如圖中所言,“當驗證變成搖骰子,尋找新發現就變成了盲人摸象”,各學科科學家普遍遭遇過實驗無法復現的情形。4.
容易被誤讀的細節(至少兩處) 第一處,統計口徑易混淆:左側的“70%”“50%”說的是實驗無法重現的比例;而右側圖表的百分比是 科學家(受訪者)中經歷過復現失敗的人的比例(“HAVE YOU FAILED TO REPRODUCE AN EXPERIMENT?”)。兩組數字單位含義不同,不能互相換算或混讀。第二處,兩根條形的含義易讀反:紅色較長的條是 Someone else's(復現他人實驗失敗),淺紅色較短的是 My own(復現自己實驗失敗),不能誤讀為“成功率”或“實驗質量評分”;淺紅條也不代表“自己實驗的失敗率”,而是“自己未能復現自己實驗的科學家佔比”。
第三處,圖表數值無精確標註:圖中條形未標數字,任何具體百分比都只是目測估算,不能當作精確數據引用。第四處,“1000 倍”是設問而非結論:標題中的“1000 倍”出現在疑問句中,圖中並未給出 AI 實際加速倍數的數據,不可讀作“AI 已加速 1000 倍”或任何具體加速數值。綜合模型的以上輸出,AI 前線認為,模型整體表現不錯,屬於“能夠直接輔助處理圖片材料”的水平。模型不僅完成了 OCR,還正確理解了圖表、文字與演講現場之間的關係,沒有出現明顯幻覺。測試二:視頻理解:時間順序與因果關係 這道題希望測試下模型的視頻理解、時間定位、動作追蹤、事件順序和因果推理方面的表現。
AI 前線上傳了一段 7 月份在上海 WAIC 期間拍攝的 30 秒左右的視頻。給出的提示詞如下: 請完整觀看這段機器人做飯的視頻,並完成以下任務: 1、列出機器人使用的食材、廚具和設備,並說明它們分別在什麼環節被使用; 2、找出至少兩個體現機器人操作能力的細節,例如抓取精度、力度控制、雙臂協同、工具使用或對環境變化的響應; 3、判斷視頻中是否出現操作失誤、停頓、重複動作的情況,並提供時間戳和畫面證據; 用 150 字以內總結機器人最終做了什麼、完成度如何。輸出結果如下: 1.
食材、廚具與設備及其使用環節 • 食材:鍋中的蝦(橙紅色,約數十隻)——全程處於翻炒環節;旁白提到“東方美食”,但未指明具體菜名與調味料種類,具體調料內容中未提及相關信息。• 廚具/設備: • 炒鍋(黑色平底鍋):置於電磁灶上,承載食材翻炒; • 鍋鏟(淺色硅膠鏟,左手持):翻炒、撥動蝦的主要工具; • 調料/油瓶(右手持的透明尖嘴瓶):在翻炒過程中向鍋內傾
Related
相關文章

AI導購“百團大戰”開打:電商十年邏輯正在被改寫
AI導購“百團大戰”開打:電商十年邏輯正在被改寫鈦客觀消費2026.09.22 17:04 · 來自湖北全文2854字00:00 / 07:49AI導購這門生意的終極KPI,從來不是GMV。“逛”淘寶這套“逛”的動作,正在退出很多人的日常。不是打開App下單,而是真正點進一家家店鋪,比價、看評論、猶豫、加購、放棄、再撿回來。它一度定義了“網購”,如今正被一個對話框悄悄替代。9月中旬,淘寶、京東、抖音、拼多多、美團、快手六大平臺已全部上線或更新AI購物能力。這一次,電商競爭的戰場,從“搶流量”轉向“拼智能”。AI貨架開始賣AI9月2日,智譜在天貓開設大模型行業首家官方旗艦店,賣的不是實物,是模型調用額度,GLM Coding Plan訂閱套餐月付118元起。9月3日,天貓上線“AI空間站”(Token充值中心),把阿里雲、智譜、Kimi、MiniMax、DeepSeek等頭部廠商的訂閱產品集中擺進同一個頁面。效果出乎意料,開店首日,智譜品牌搜索量環比上漲40倍;48小時內攀升至50倍,同期帶動淘寶天貓平臺AI Token等訂閱類產品成交環比增長超160%。京東隨後上線“AI軟件充值館”,展示智譜、Seedance、DeepSeek、豆包等模型。中國移聯教科院執行院長陳曉華的評價是,詞元Token正從技術計量單位,加快向“可購買、可定價、可流通的數字服務商品”轉變,這將推動大模型商業模式從“模型競爭”走向“Token消費和生態競爭”。過去是電商平臺用AI賣貨,現在是AI本身成了貨架上的商品。這場戰役的性質已經改變。與此同時,電商的貨架邏輯,正在失效。過去十年,電商的底層模型極其簡單:平臺建貨架,商家買流量,消費者做決策。商家競爭的本質是“注意力採購”;消費者決策的本質是“逐頁篩選”。這套模式養活了整個產業鏈,也製造了天花板:注意力越來越貴,決策越來越累。艾媒諮詢CEO張毅觀察到

首屆中央企業量子人才科創空間產業應用創新大賽在合肥舉辦 中央企業發佈真實業務場景需求
首屆中央企業量子人才科科创空間產業應用創新大賽在合肥啟動,由五家大型央企聯合承辦,針對通訊、能源、金融等五大賽道發布超過50項真實業務需求,並開放核心科研資源供參賽團隊使用。獲獎項目將進入為期六個月的量子科創營,獲得資本對接與產業落地支持,旨在推動量子技術從實驗室走向市場。

小米18 Pro系列首發傳奇一瞬大模型影像,用端到端大模型把相機級光學虛化裝進手機
這一代最惹眼的王牌,是首發傳奇一瞬大模型影像——靠一套端到端的影像大模型,把相機級的光學虛化搬到了手機上,官方宣稱成像質感足以媲美專業相機。它的打法很聰明:把傳感器數據直接送上雲端,依託百萬量級樣片做多維度訓練,最終讓虛化效果落到接近光學鏡頭的質感。

阿里試水QwenBook AI設備,團隊規模約150人
目前該產品仍處於早期試水階段,主打辦公場景,接入模型包括Qwen3.8-Max和Qwen3.8-Flash。據一位阿里雲人士透露,QwenBook的產品定義和硬件部分由團隊自主研發,同時將無影此前在雲電腦領域積累的系統及端雲能力帶入項目。目前QwenBook團隊約150人,系統團隊主要基於無影和阿里雲OS團隊重新組建,硬件團隊則吸納了多名頭部手機廠商相關人才。

企業爆買AI Box
半導體產業縱橫2026.09.22 15:53 · 來自北京全文4115字00:00 / 11:32AIBox是算力買斷,還是買內存送處理器的營銷手段?文 | 半導體產業縱橫一臺放在辦公桌上、比機頂盒大不了多少的機器,塞著上百 GB 統一內存,斷網也能跑千億參數大模型。不用機房,不用機櫃,插電即用,數據不出房門。這就是AI Box,一臺搬上辦公桌的數據中心。AI Box賽道中蘋果、英偉達、AMD、微軟、英特爾悉數到場。但這種形態並不新鮮,為何2026年“連上顯示器就是臺電腦”的小盒子成了必爭之地?

阿里雲棲大會亮出最激進AI藍圖: 5 萬億至 10 萬億參數模型在途,自研真武V900 芯片算力翻三倍
首席執行官吳泳銘宣佈,公司正準備訓練參數規模介於5萬億至10萬億之間的新一代模型,這是阿里迄今最激進的AI發展計劃,也意味著它要從雲計算服務商進一步蛻變為全棧人工智能平臺。按照披露,這款仍在研發中的新模型將成為通義千問(Qwen)系列的重要後續產品。