橫掃四榜,DM0.5 憑什麼面面俱到?

2026年9月15日 10:21
橫掃四榜,DM0.5 憑什麼面面俱到?
站內 AI 整理稿

本文作者: 鄧哲敏 2026-09-15 10:22 導語:單科冠軍不夠,具身智能落地需要沒有結構性短板的底座 單科冠軍不夠,具身智能落地需要沒有結構性短板的底座 作者丨鄧哲敏 編輯丨齊鋮湧 一個模型同時佔據四個能力子榜單的榜首,這在具身智能行業裡不多見。RoboColiseum 是由智元機器人發起,聯合高校、科研機構、開源社區及機器人企業共同建設的評測平臺,它把評測拆成四個維度:指令跟隨、空間理解、擾動適應、通用操作。參評者只要在任何一個維度上有結構性短板,就會在對應的子榜上掉下來。而原力靈機的通用具身基礎模型 DM0.5 在四個子榜上全部排名第一,且目前是唯一做到這一點的模型。

AI科技評論((公眾號:)公眾號)想知道,這張成績單有多可信?DM0.5 又憑什麼霸榜?01一把可信的尺子演示效果和真實場景之間存在差距,這在機器人行業早不是什麼新鮮事。普通商品尚有賣家秀與買家秀之別,遑論技術尚未成熟的具身智能。因此,模型越是層出不窮,行業就越需要可信賴、細顆粒的公共標尺,幫助挑選出真正的強者。然而現實並不樂觀,AI科技評論觀察到,具身評測行業長期存在幾個痛點,讓分數的可信度打了折扣。第一個痛點,是仿真跑分高、真機落地差。仿真環境裡的物理參數、視覺渲染和真實世界相差甚遠,模型在仿真裡得了高分,搬到真機上可能是一塌糊塗。

市面上大部分仿真評測基準並沒有做系統的真機-仿真對比實驗,更沒有公開結果。針對 Sim2Real 的一致性問題,RoboColiseum 負責人吳墨告訴AI科技評論(公眾號),平臺通過空間智能技術在仿真環境中高保真重建真實世界,配合激光雷達還原幾何信息,再對物體的質量、重心、碰撞幾何、動靜摩擦力、轉動慣量,以及機器人本體的相機內外參、剛度阻尼、末端控制響應等物理參數逐項校準。最終驗證結果顯示,仿真與真機的模型表現一致性達到 89.5%,單個任務的成功率差異均小於 10%。第二個痛點,是評測基準生命週期短。具身模型迭代太快,一套榜單推出後半年,頭部模型就把分數堆滿了,無法再區分好壞。

“刷榜”現象在大語言模型領域早有端倪,原本被設計為終身學習的 LIBERO,從發佈到被刷穿,只堅持了不到三年。RoboColiseum 現有 78 個評測任務、超過 3000 個泛化 case,訓練集和評測集完全隔離,評測集對每個任務都做了充分的泛化配置,讓軌跡回放類方案徹底失效。第三個痛點,是單點能力強不代表真實場景好用。行業裡不少評測基準的設計,本質上是在考一道題——把模型在某個原子能力上壓榨到極限,然後把這個數字當成模型能力的代理指標。這種評測邏輯在能力單一、任務簡單的早期階段是夠用的。但問題在於,真實場景的任務幾乎沒有一個是單科題。

工廠裡的分揀機器人,要同時聽懂調度指令、判斷傳送帶上包裹的空間位置、應對隨機擺放姿態的干擾,最後把一系列原子動作組合成完整的操作流程。單點能力強的模型進了真實場景,這邊表現不錯,那邊掉鏈子,整體任務完成率依然慘淡。而 RoboColiseum 圍繞四個維度展開評測,分別對應機器人在真實世界中完成任務所需要的能力分層:指令是基礎,空間是認知,擾動是魯棒,操作是落地。從語義到物理,從感知到執行,構成了一套相對完整的考察鏈條。02四榜同時第一,遠比單項第一難在四大子榜單上,原力靈機 DM0.5 以指令跟隨 0.8444、空間理解 0.6146、擾動適應 0.7344、通用操作 0.

6370 的成績,全部排名第一。四榜同時第一比單項第一難得多,因為這四個維度考的是不同層次的能力,彼此之間並不互相加持。一個記憶能力超強的模型,未必能在空間理解上佔優;擅長執行精細操作的模型,未必在擾動適應上穩得住。四個子榜,相當於對模型做了四次獨立考核,任何一個短板都會直接體現在對應的排名上,無法被其他維度的優勢掩蓋。這也是為什麼行業裡單項能力突出的模型並不少見,但能同時在多個維度維持領先的模型極少。我們仔細研究了 DM0.5 的架構和數據源,每個維度上都有具體的技術支撐。指令跟隨方面,DM0.

5 在預訓練階段設計了具身思維鏈:動作生成之前,模型要先走完一套內部推理流程——目標物體在哪、上一步幹了什麼、這步該不該結束、不這麼幹會怎樣。11 項推理任務覆蓋任務規劃和動作生成兩個層面,逼模型理解“指令×本體×環境”三方的關係,而不是背答案。這一層預訓練能力沉澱下來之後,DM0.5 展現出 zero-shot 級別的泛化——在沒有見過的任務配置上,仍然能應對多樣的動作組合和語言條件約束。空間理解方面,DM0.5 的預訓練數據包含 10 萬小時 Egocentric 視頻,並基於這些數據支持毫米級精度的 3D 空間標註生成。

這意味著模型在預訓練階段就在大規模地學習從第一視角理解三維空間,而不是事後用有限的機器人操作數據“打補丁”。我們注意到,原力靈機與天津大學、清華大學合作的論文《GeoVLA: Empowering 3D Representations in Vision-Language-Action Models》入選 IROS 2026 認知機器人最佳論文獎提名,核心工作正是把三維幾何表徵顯式引入 VLA 模型的決策過程——讓模型不只在二維圖像空間裡做判斷,而是在具有深度、距離和幾何關係的三維世界裡理解場景。擾動適應和工業落地最直接相關,這方面,DM0.5 靠兩件事兜底。

一是推理速度:通過多項工程優化,模型核心延遲從 534 毫秒壓到 57.49 毫秒,9.29 倍加速,同時在 2000 個 LIBERO 測試 episode 上成功率幾乎無損(98.45% 降至 98.40%)。人眨一次眼約 100 到 150 毫秒,DM0.5 的“感知-思考-出手”全流程比眨眼還快,干擾發生的瞬間,模型已經完成了重新感知和決策。二是原生 60 秒記憶:即使任務被中斷,模型知道剛才做到哪裡了,能夠續接而不是從頭來。通用操作方面,考的是在前三項能力全部就位之後,把原子技能有效組合完成完整任務序列的能力。物流分揀場景裡,DM0.

5 不依賴預設腳本,純靠實時視覺識別和決策,平均 3 秒一件,準確率超 99%;亞毫米積木拼裝場景裡,出現接錯時能自主感知失敗,半秒內調整姿態重新抓取糾錯,每 12 秒完成一次拼裝,全天候無間斷;靈巧手場景裡,DM0.5 配合後訓練,控制帶有 58 個自由度的靈巧手完成切黃瓜、削黃瓜等廚房任務——柔性物體形狀隨機、易滾動,傳統工業機器人靠預設軌跡根本無法應對,只能讓底座模型實時感知、實時決策。03底座模型能力的直接檢驗第一的獲取方式,值得拿出來單獨說。DM0.

5 在 RoboColiseum 上的路徑是:強大的預訓練底座,沒有針對評測任務做專項優化,只是通過常規監督微調將模型能力遷移到了 RoboColiseum 的機器人構型和任務上,完成從底座到榜單任務的適配。這個細節的意義在於,它讓這份成績更接近對底座模型真實能力的測量,而不是對評測優化技巧的測量。額外對齊並非沒有價值,但在具身領域,這類介入往往意味著模型開始針對特定的任務做定向優化。這種優化在某些場景下效果顯著,但也容易讓模型的泛化能力下降——在訓練分佈內表現優異,出了分佈就掉價。DM0.

5 靠 SFT 就能登頂,說明它的預訓練底座在指令理解、空間感知、歷史記憶和動作生成上,已經形成了足夠堅實的通用能力基礎。這種通用性,才是支撐它在不同評測框架下都能維持領先的根本原因。04其他維度的佐證原力靈機並非第一次拿到這樣的好成績。上個月,DM0.5 剛剛登頂 RoboDojo——由香港大學多媒體實驗室聯合 UC 伯克利、清華大學等全球近 20 所頂尖機構共同發起的權威評測基準。AI 科技評論當時專門做了一篇深度分析,重點在於 Memory 維度。DM0.5 在記憶維度上取得 47.74 分和 47.44% 的成功率,而第二名只有 13.37 分和 12.

11%——得分差了 3 倍多,成功率差了接近 4 倍。如果說 RoboDojo 是一次橫向比較,那麼 DM0.5 在其他評測基準上的縱向成績,則構成了另一條佐證線索。在真機與仿真評測中,LIBERO 綜合成功率達到 99.0%;RoboTwin 2.0 簡單和複雜場景下成功率分別為 93.6% 和 93.3%;VLA-Arena 三檔難度下依次為 89.0%、53.6%、44.1%;導航場景仿真測試中,R2R 和 RxR 的 Val-Unseen 成功率分別達到 59.7% 和 65.5%,相比所有基線方法均取得顯著優勢。

真機評測 RoboChallenge Table30 V2 裡,面對 ARX5、UR5、ALOHA、Dexmal-Mirror 四種異構機型、30 個複雜任務,DM0.5 以 43.0% 的整體成功率、54.42 的綜合得分同樣位列第一。跨越仿真與真機、覆蓋操作與導航、兼容單一機型與多種異構構型,這些數字共同指向同一個結論:DM0.5 的成績並非依賴某一個場景或評測框架的特殊適配,而是在多個獨立的考場上反覆被驗證過的。第三個佐證來自國際同行的引用。

Physical Intelligence(π)在兩次關鍵輸出中,都將原力靈機的 MemoryVLA 納入了學術參照系:一次是發佈具身記憶架構論文 MEM(Multi-Scale Embodied Memory for Vision Language Action Models),一次是將 MEM 的理念落地為旗艦產品 π0.7。MemoryVLA 受認知科學中工作記憶與海馬體雙機制啟發,提出感知-認知記憶庫,構建了一套面向動作控制的雙流 latent memory 機制。

PI 在大腦和小腦的全局視角定義問題,而 MemoryVLA 則在小腦記憶這條路徑上給出了一套經過大規模實驗驗證的完整方案。兩者是獨立探索、方向趨同,這大概是 PI 連續兩次引用的原因。05推理提速、全面開源、真機落地DM0.5 目前的狀態,可以用三件事來描述。第一件:推理速度進入實時控制的時間窗口。通過 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core、Triton 融合算子和 CUDA Graph 的聯合優化,DM0.5 的模型核心延遲從 534 毫秒壓到 57.49 毫秒,API 響應控制在 70 毫秒內(p50 67.

75 ms,p90 70.01 ms),累計加速 9.29 倍,延遲降低 89.2%。整套 VLA 推理系統快了一個數量級,大模型的智力第一次跑進了實時控制要求的時間窗口。第二件:全面開源。DM0.5 模型權重、訓練框架,以及從 LIBERO、RoboTwin 2.0 到 RoboChallenge、真機 SO101 的多個下游任務完整工作流,已陸續在 GitHub 和 Hugging Face 上開放,核心代碼也提交給了 LeRobot 社區。這個選擇的背後有一個值得關注的行業邏輯:具身智能目前最缺的不是哪家公司獨佔一切,而是一個經過全科驗證的公共底座。

一個全科有效的底座開源出來,開發者可以把有限的資源用在特定場景的微調和落地上,而不必從零開始驗證架構是否可靠。國際電信聯盟(ITU)具身智能焦點組首次線下會議上,原力靈機當選了“開源生態”工作組組長單位。第三件:真機落地持續推進。原力靈機已在多個真實場景中部署測試:大型國際零售商倉儲中,多臺搭載 DM0.5 的機器人正與其他類型機器人協同作業,完成商品搬運與分揀;大型 3C 製造商工廠裡,搭載 DM0.5 的機器人正配合生產線進行包裝和廢料回收。從榜單到工廠,這是評測成績在真實世界中被驗證的下一步。

06全科優秀,才是真正的通行證RoboDojo 和 RoboColiseum,一個由頂級學術機構操持,一個由產業機構主導;一個側重記憶、長程執行和開放語義,一個側重指令理解、空間認知、魯棒性和操作組合。兩套體系的出題邏輯幾乎沒有刻意對齊,但 DM0.5 在兩個考場上都站在了最高處。具身智能的評測體系還在建立中,行業至今沒有一個像大語言模型那樣被普遍接受的權威基準。在這個標準尚未收斂的階段,能在多個不同方向的嚴格評測上都穩在第一梯隊,含金量反而比刷穿某一套題更重。因為它證明的是,在標準統一之前就已經做好了應對任何標準的準備。

AI 科技評論之前寫道,“全科優秀,才是進入百萬小時時代的必要條件,每門課都沒有結構性漏洞,數據才會真正轉化為能力。”這句話說的是數據 Scaling 的前提。而現在看來,它同樣適用於落地:工廠要求魯棒性和節拍,家庭要求語義理解和精細操作,倉儲要求長程穩定性,沒有哪個真實場景會遷就你的短板。一個能力有結構性漏洞的模型,在某一類場景裡可能跑得不錯,但很難真正跨越到普適落地。這也是為什麼四榜同時第一,比任何一個單項冠軍都更值得關注。只有整個能力譜系足夠寬、足夠均衡,才能同時承接真實世界裡多樣的任務要求。物理世界的智能,靠單科狀元是不夠的。

行業最終需要的,是能經得住不同考場、不同考官、不同考題的長期答題者。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 原力靈機 DM0.5 RoboColiseum 沒有全科優秀,具身模型別想進入百萬小時 對話原力靈機範浩強:為什麼要用機器人「建造長城」 ...泛化湧現!原力靈機三級火箭助推具身智能落地 擺拍Demo無意義,原力靈機Ferrata把機器人系統化送進 ...

鄧哲敏 編輯 發私信 當月熱門文章 機器人首秀網球場,銀河通用突破具身智能「AstraTennis時刻」 WRC 2026 風向標:具身智能下半場,比「大腦」更比「賬本」 國內第一視角數據最早押注者,北大盧宗青:隱空間才是具身的路 中國電信領投,覓蜂科技再獲數億元融資,聚焦物理AI數據服務平臺 具身智能開始進入「下半場」:從會幹活到幹完活 最新文章 強化學習大本營新作:如何破解「學新忘舊」困局 大模型牌桌上,螞蟻如何出牌?OpenAI 攻克千禧難題?深度拆解 1 萬個 Agent 如何造出流體奇點 Astra 非機器人驗證 48 關全通,再見 reCAPTCHA!拆解 Claude 5.

1:38 小時不睡覺的背後,Anthropic 正在終結「模型論」 連尚集團入選上海市首批算力生態合作伙伴名單 熱門搜索 人工智能 智能硬件 英偉達 平板電腦 中國移動 字節跳動 數據 工信部 大華 徐小平 紅米

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

4 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

5 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

9 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

10 小時前