沒有全科優秀,具身模型別想進入百萬小時
原力靈機登頂 RoboDojo:一個專門給機器人"卸妝"的考場。最近的朋友圈,幾乎被機器人運動會和 WRC 2026 上的各種視頻刷屏了。看多了機器人百米衝刺、跳遠,再看各個展臺疊衣服、衝咖啡,很容易得出一個結論:機器人時代來了。然而,如果你不幸參與過這些演示背後動輒幾千次的調試與過擬合,你就會清楚這裡面的水有多深。行業內管這種情況叫"Demo 濾鏡"。濾鏡有多厚?說實話,即使你積累了一些行業知識,在現場盯著看,你也未必分得清:這個演示到底是提前編好的動作,還是模型在實時驅動。這些信息差,讓具身行業多少有些魚龍混雜。好在,學術界還留著幾面"照妖鏡",比如 RoboDojo。
01一個不許擺拍的考場這是一個來頭不小的權威評測:由香港大學多媒體實驗室牽頭,聯合 UC 伯克利、清華等全球近 20 所頂尖機構,背後是知名仿真基準 RoboTwin 的原班人馬。它乾的事用一句話概括:給全世界的機器人模型辦一場統一高考。其中,42 道題,考泛化、記憶、精細操作、長程執行、開放語義理解五個科目;另外還有18 道題,考場裡擺著三種雙臂機器人(ARX X5、Piper 等),燈光、復位流程、部署接口全部統一,評審雙盲打分,既看結果也看過程。翻譯一下:不許自帶考具,不許挑題,不許擺拍,仿真、真機分開考。成績單相當慘烈。
截至今年 7 月,仿真榜上 30 多個參評模型裡,不乏大家熟悉的 π0.5(Physical Intelligence)、英偉達 GR00T-N1.7、OpenVLA-OFT,全是這個賽道叫得上名號的選手,頭部模型的平均成功率只有 8.80%,作為對比,人類專家是 76.03%。真機榜更慘:頭部模型總體成功率 12.8%,人類 100%。最難看的是開放語義任務,成功率只有 1.67%。1.67% 是什麼概念?考 60 次,蒙對 1 次。而同一個考場裡的人類,滿分。所以這個榜單暴露的,不是哪家公司不行,而是一個行業級現實:現在的具身模型,絕大多數離落地還很遠。
然而最近,RoboDojo 的一家中國具身頭部公司:原力靈機。它的通用具身基礎模型 DM0.5,以 24.90 的綜合得分、19.34% 的平均成功率,雙項第一,綜合排名登頂。02分數之外,先看它幹活的樣子從去年底開始,AI 科技評論判斷一個具身模型的含金量時,就越來越關注榜單之外的東西,它幹活的樣子。畢竟,分數是給人看的,活是給世界乾的。我們特地找到了 DM0.5 的 GitHub 倉庫,結果看到了一些讓人意外的細節。先從一個測試視頻開始。桌上隨機擺著紅、綠、藍三塊積木。給你三個杯子,從左到右把它們挨個蓋住。等顏色全部遮住,再按紅、綠、藍的順序,把杯子依次揭開。聽著像逗小孩的。
沒錯,三四歲的小孩確實能輕鬆完成,順便還會嫌你無聊。但讓機器人來呢?很遺憾,絕大多數"具身大腦"都會當場露餡:不是顏色記錯,就是步驟亂套。因為現在的具身模型,大多和金魚差不多:走一步,忘一步。主流 VLA 模型做決策時,只看眼前這一幀,或者最近幾幀畫面。十秒內的短任務沒問題,抓個杯子、按個按鈕,靠本能反應夠了。但真實世界的活兒幾乎都是長程的:做一頓飯半小時,收拾一間屋子一小時,流水線一站一整天。沒有記憶,機器人就永遠只能活在 10 秒的 Demo 裡。這個"杯子蓋積木",正是 RoboDojo 裡的一道真題,任務名叫 Cover Blocks,考的就是記憶。DM0.
5 的表現,三個隨機種子,DM0.5 全部 100% 通過。注意,拿滿分還有兩個附加條件:杯子姿態全程有效,結束後物歸原位。也就是說,它不是蒙對了一次開蓋順序,而是穩定走完"觀察、記憶、按序執行、善始善終"的完整閉環。如果你是做具身算法的,就知道這個表現有多驚豔。這個 100% 的含金量,放到榜單裡更直觀:Memory 維度,DM0.5 拿到 47.74 分、47.44% 的成功率;而全場第二名,只有 13.37 分、12.11%,得分差了 3 倍多,成功率接近 4 倍。Memory一直是原力靈機的強項。
PI的Mem具身記憶架構論文,就引用過原力靈機的MemoryVLA,肯定了其在具身記憶方向的探索。近期旗艦π0.7論文再度引用該成果。π0.7作為全球泛化頂尖的機器人基礎模型,架構基於PI的Mem框架,而MemoryVLA在“小腦記憶”路線的研究,為PI提供重要參考。兩次引用,足以證明原力靈機在具身智能記憶領域的能力。而這次按榜單的五維綜合評價,Memory 正是 DM0.5 拉開差距、最終登頂的關鍵科目。03治"金魚病",為什麼這麼難可能有讀者會問:既然記憶這麼重要,為什麼這麼多公司不去攻克?首先是貴。把幾十秒的歷史畫面塞進模型,上下文一拉長,計算量暴漲,架構也得重新設計。
多數團隊的選擇是先把短任務跑通,記憶以後再說。這個劇情其實眼熟。大語言模型的進化史,幾乎就是一部上下文長度的擴張史:從幾千 token 到十幾萬、上百萬,模型記得住的東西越多,能力就發生一次質變——從陪聊到讀論文、寫代碼、當 Agent。上下文,就是語言模型的記憶。而如果具身行業因為"貴",一直解決不了大腦的記憶問題,那不管機器人是進工廠還是進家庭,都是個闖禍精。DM0.5 為什麼能把記憶做成殺手鐧?我們翻了它的開源論文,找到了相關章節:簡單說,DM0.5 是把記憶從後面臨時打的補丁,變成預訓練階段就長進去的原生能力。具體有三招:第一招在架構。DM0.
5 由 4B 的 VLM 多模態主幹加 680M 的 Action Expert 組成,中間專門設了一個"上下文抽象層":用高效的信息壓縮,讓 VLM 在預訓練階段就原生學習歷史信息,原生支持最長 60 秒記憶,一套架構通吃可變長的時間窗口。關鍵是"原生"兩個字:不是把長曆史硬塞進去硬算,而是讓模型從小學會把歷史壓縮著用。第二招在預訓練。圍繞歷史上下文、具身推理、動作監督、數據質量做系統升級,讓長程記憶、指令理解、動作連續性、抗干擾作為一個整體長出來,而不是東拼一塊、西湊一塊。第三招在微調。針對下游任務的 SFT 裡直接加入 20 秒歷史觀測,把預訓練攢下的時序理解能力,真正遷移到考場任務上。
三招的回報,就是 Memory 維度那條接近 4 倍的分差。04只會背書,拿不了狀元不過按官方的說法,DM0.5 的登頂並非依賴某一項單點能力,而是預訓練與針對性 SFT 共同帶來的整體提升。我們在倉庫裡核對了一圈,確實如此。LIBERO 綜合成功率 99.0%;RoboTwin 2.0 簡單和複雜場景分別是 93.6% 和 93.3%;VLA-Arena 三檔難度下 89.0%、53.6%、44.1%;導航任務 R2R、RxR 的未見場景成功率 59.7% 和 65.5%,全面壓過基線方法。
在另一項同樣"魔鬼"的評測 RoboChallenge Table30 v2裡,面對 ARX5、UR5、ALOHA、Dexmal-Mirror 四種不同構型的機器人、30 個複雜任務,DM0.5 以 43.0% 的整體成功率、54.42 的綜合得分位列第一。榜單看到這裡,我們更好奇了:DM0.5 落到真刀真槍的活兒上,到底能不能打?官方放出的實機演示裡,有幾段值得細看。第一段是拼微型積木。最小組件寬度不到 1 釐米,抓取和扣合要在 0.1 到 1 毫米的尺度內完成,而人手的自然抖動極限差不多就是 0.3 到 1 毫米——這個活的精度要求,正好卡在人類手抖的誤差帶裡。DM0.
5 控制下的機械臂有個很"人"的動作:先對準,再輕輕一震,抖著往下壓,用一股"寸勁兒"把積木送進卡扣。更神奇的是出錯的時候。高強度連續作業中,難免有積木因角度偏差接錯。它沒有死板地繼續拼,而是自主感知到了"拼裝失敗":停頓大約半秒——那半秒很像人發現不對時的愣神——然後調整姿態、重新抓取、修正位置、再度按下。平均每臺機器人 12 秒完成一次拼裝,全天候無間斷。再比如削黃瓜和切黃瓜。削黃瓜這類需要精細力控的柔性任務,靠的是通過關節電機的電流值實時感知作用力,對接觸力做精確判斷。切黃瓜聽著簡單,但執行端是一雙 58 個自由度的靈巧手:握刀、扶穩、下刀、控制力道。
黃瓜是軟的、會滾動、每根形狀都不一樣,這種柔性物體,靠寫死軌跡的傳統工業機器人根本碰不了,只能讓底座模型實時感知、實時決策。DM0.5 加一層針對性後訓練,就把 58 個自由度管了起來。物流分揀則是另一個極端,考的不是細,是快。傳送帶上包裹堆疊、材質各異、姿態隨機,DM0.5 不用預設腳本,純靠實時視覺識別和決策,平均 3 秒分離一件,準確率超過 99%。還有一段抗干擾測試,讓人印象很深。機器人正在收拾桌面,人類中途強行把它推開、相機被猛晃,它的反應是:停下來看清楚,接著幹——還記得剛才的東西收到哪了。這背後就是前面說的原生 60 秒記憶:它能記住整整一分鐘內自己做過的所有動作。
這個能力還有個順手的衍生品:既然記得住長序列,它就能直接"看懂"人類的演示視頻,看完跟著做。繞開語言,看視頻上崗。()05同一個考場,憑什麼它分高記憶是殺招,但一場五門課的考試,光靠一門贏不了。DM0.5 的基本盤,還有三樣東西。先說數據。具身智能和聊天機器人最大的區別是,語料沒法從互聯網上白嫖。網上有幾萬億字的文本,但沒有"機器人第一視角抓杯子"的數據,這玩意只能拿真機一小時一小時地採,又貴又慢。
原力靈機在數據上的家底有三大塊:真機數據:5 萬小時高精度操作數據,做到秒級指令-動作對齊;Egocentric 數據:10 萬小時第一視角視頻,能生成毫米級精度的 3D 空間標註;場景重建數據:100 萬平方米空間建模,把真實室內環境高精度數字化,讓模型在仿真裡訓練時,看到的考場和真機考場儘可能一樣。高質量數據才能帶來高質量智能。這套覆蓋導航、抓取、全身控制三大任務、六類機器人本體的數據資產,把仿真與現實的鴻溝一寸一寸填平。再說腦子。團隊內部有句話說得挺直白:"沒有語言能力的 VLA,就是數據集復讀機。“如果模型只是把畫面死記硬背地映射到動作,換個場景就廢。DM0.
5 加了一層"具身思維鏈”:動作生成之前,模型要先想清楚一串問題——目標物體在哪、上一步幹了什麼、這步該不該結束、不這麼幹會怎樣(反事實推理)。11 項推理任務,逼模型真正理解指令、環境和自身的關係,而不是背答案。最後是最硬核的一塊:速度。VLA 模型一直被一個問題卡著脖子:模型越大越聰明,但推理越慢。如果模型半秒才能給出一次動作指令,機器人就像喝了半斤白酒,眼睛看著杯子掉下去,手就是來不及。行業裡的解法是"雙系統":慢系統想清楚,快系統手上快。Figure 的 Helix、英偉達的 GR00T 都走這條路,算是行業共識。DM0.
5 也是雙系統:Sys2 負責理解指令、預判大局,Sys1 動作專家網絡負責高頻響應。差別在於,原力靈機把推理速度捲到了離譜的水平:通過 Vision TensorRT、FP8、CUDA Graph 等一串工程優化,模型核心延遲從 534 毫秒壓到 57.49 毫秒,9.29 倍加速,API 響應控制在 70 毫秒內。而且在 2000 個 LIBERO 測試 episode 上,成功率只掉了 0.05 個百分點(98.45% → 98.40%),幾乎無損。57 毫秒什麼概念?人眨一次眼大約 100 到 150 毫秒。DM0.5 的"思考加出手",比眨眼還快。
大模型的智力,第一次跑進了實時控制要求的時間窗口。前面演示裡,它能接住人類的突然打斷、能在流水線上 3 秒一單,靠的就是這個。06考第一的DM0.5,居然是一個開源模型聊開源之前,得先說清楚這場"全科第一"為什麼值錢。同一個模型,在仿真、真機、導航、精細操作這些差別極大的場景裡都跑進第一梯隊,這在具身行業並不多見。它釋放的信號是:具身模型的能力上限,正在被真正看見。更關鍵的是,行業現在把寶全押在數據上,"百萬小時"幾乎成了口頭禪。但數據 Scaling 有個常被忽略的前提:木桶能裝多少水,取決於最短的那塊板。記憶、推理是短板,灌再多數據,水照樣從短板流走。
全科優秀,才是進入百萬小時時代的必要條件,每門課都沒有結構性漏洞,數據才會真正轉化為能力。DM0.5 考出的,正是這張"值得灌數據"的門票。然後才是開源的故事。按商業劇本,考第一的模型應該捂著,賣 API、賣授權,把領先優勢變現得越久越好。原力靈機反著來:DM0.5 全面開源。模型權重、訓練框架,從 LIBERO 到 RoboTwin2、RoboChallenge 再到真機 SO101 的完整工作流,陸續放上 GitHub 和 Hugging Face,核心代碼也提交給了 LeRobot 社區。前陣子,國際電信聯盟(ITU)具身智能焦點組首次線下會議,原力靈機當選"開源生態"工作組組長單位。
這個選擇接住了上面的邏輯。具身智能缺一個公共底座:每家公司都在重複造輪子,中小團隊根本進不了場。一個經過全科驗證的底座開源出來,等於告訴所有開發者:放心往裡灌數據,這隻桶沒有洞。短期看是讓渡壁壘,長期看,誰成為生態的默認底座,誰就拿走最值錢的門票。RoboDojo 那張 1.67% 的成績單,短期看是行業的難堪,長期看是好事:具身智能終於有了一把沒人能作弊的尺子,"我家機器人很智能"這句話,從此需要證據。而登頂之後選擇開源的 DM0.5,把尺子、證據和答卷一起放到了所有人面前。物理世界的智能覺醒,可能就從有人願意公開答卷開始。
()上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

一覺醒來20個PR自己合進了主幹,SpaceXAI工程師:我基本不看代碼了
SpaceX的AI工程師透露,團隊導入自動化開發流程後,AI不僅能生成程式碼,還能自動提交並合併Pull Request,他醒來發現20個PR已自動進入主幹,幾乎不需手動檢視。這種做法大幅減少例行工作,但也引發程式碼品質與安全性的疑慮,顯示AI正從輔助工具轉為主動執行者,可能成為未來軟體開發的新常態。
滴滴自動駕駛新一代車型開啟載客測試服務
本文作者: 於 2026-08-31 16:43 導語:近期,滴滴自動駕駛新一代 Robotaxi R2 正式開啟無人載客測試服務,用戶在北京、廣州部分示範區域內可呼單體驗。近期,滴滴自動駕駛新一代 Robotaxi R2正式開啟無人載客測試服務,新車在自動駕駛性能和座艙體驗上全面升級,用戶在北京、廣州部分示範區域內可呼單體驗全新智能出行服務。
不到四百美元還能自己動手訓練!Hugging Face 推出微型開源雙足機器人Microduck
Hugging Face 推出微型開源雙足機器人Microduck發布於AI新閒資訊時間 :Aug 31, 2026閱讀 :1分鐘Hugging Face 旗下開源機器人公司 Pollen Robotics 近日正式開源了一臺迷你雙足機器人——Microduck(微鴨)。
LAION開放千萬小時視頻
LAION 近日發布了一個名為 BVD 的開放影片資料集,內含超過 8000 萬段影片片段,總時長達到 1000 萬小時。這項資源將提供給學術界與開發者使用,有助於進一步推動多模態 AI 模型的訓練與研究。 根據官方說明,BVD 資料集在訓練效果上表現突出,與先前的 InternVid 資料集相比,使用 BVD 訓練的模型在相關基準測試中最高可提升 2.1 個百分點。這意味著更大規模、更多元的開放影片數據,能夠有效強化模型對動態場景的理解能力。