具身大滿貫還全開源!原力靈機DM0.5登頂RoboDojo,且clone且珍惜
這次,原力靈機的DM0.5,登頂了具身「珠峰」——RoboDojo。要知道,這可是RoboDojo啊。。。魔鬼級的具身評測,由香港大學多媒體實驗室聯合加州大學伯克利分校、清華大學等全球近20所頂尖學術機構共同發起。這些頂尖學府的「品控」有多嚴格?這麼說吧,截至2026年7月,仿真榜單頭部模型平均成功率僅8.80%,真機榜單僅12.8%。是的,仍在個位數掙扎。反正就是難度和真實性極高,專治實驗室閉門造車的偏科生。如今,DM0.5拿下了第一—— 綜合得分:24.90 平均成功率:19.34% 此外,仔細看了下表格,發現這個模型有個極其突出的強項—— 記憶。
具體可以看這個Cover Blocks任務: 機器人先從左到右蓋住隨機排列的紅、綠、藍三個積木。當顏色被完全遮擋後,再根據此前觀測,按紅、綠、藍的順序依次揭開。DM0.5在三次隨機考試中,都取得了100%成功率。反映在數據上也很直觀,RoboDojo榜單中的Memory維度,DM0.5直接猛砍了47.74分,顯著領先。。。絕對是助力其登頂,最關鍵的絕殺了。這還沒完。其他權威評測,DM0.5也都打爆了。LIBERO:綜合成功率99.0% RoboTwin 2.0:簡單和複雜場景下成功率分別達到 93.6% 和 93.3%, VLA-Arena:不同難度設置下的成功率分別達到 89.0%、53.
6%、44.1%。RoboChallenge Table30 v2:綜合得分54.42,成功率43%。而這個SOTA級別的大腦—— 早已開源。一個基模,六類場景全通過 榜單數字終究是抽象的。DM0.5的真實能力到底如何,還得看demo。而原力靈機,大概是當前場景demo最豐富的基礎模型廠商。抗干擾、拼積木、學黃瓜、分揀快遞……給我看的眼花繚亂。但回過頭來仔細一樣,這些看似分散的demo,其實指向同一件事: 基模的泛化能力。我們一個個說。1、人類示教。這是我覺得最有意思的demo。DM0.5化身卡卡西,人類示教一次,它便能光速複製粘貼。說實話,這項技能點其實並不陌生,大家都在做這個方向。
畢竟物理世界場景稀碎,你模型做得再好,總有泛化性覆蓋不到的長尾任務,這類場景下魯棒性會驟降特別多。這就永遠到不了具身的ChatGPT時刻。目前業內的共識解法是:不追求預訓練解決一切,而是在落地環節引入Human-in-the-Loop。讓人類工作者拍攝一段示範視頻,機器人便能像開了「寫輪眼」一樣即時對齊並跟隨完成複雜任務。讓教機器人,變得像教徒弟。原力靈機做的便是這件事。而開頭提到的「記憶」,則是解法的關鍵。DM0.5原生支持最長60秒的記憶能力,機器人能深度記住並連貫審視自己此前做過的所有動作序列。基於這份長記憶,模型可以直接跨越語言限制,理解人類演示的視頻片段。2、精細操作。
原力靈機選擇的場景,是積木。其實今年7月我在上海WAIC看過這個demo,說實話,比視頻裡的精彩得多。原力靈機聯手階躍,擱展區裡拼了個長城。。。是的,6臺機器人,耗時15小時,用 81920塊微型積木拼出長3.5米的長城模型。現場也是擠爆了,鑽都鑽不進去。但這絕對不是個「情緒價值」demo。積木拼裝,最小的組件寬度不到1釐米,機器人必須在0.1到1毫米的尺度內完成抓取和扣合。這個精度,已經超越了人手約0.3到1毫米的自然抖動極限。與此同時,微型積木存在工藝公差,直接大力出奇跡的話,極易錯位卡死。所以如果仔細看視頻,你會發現個蠻有意思的細節。這哥們會寸勁兒啊!
機器人會先對準,再輕輕一震、抖動下壓,把積木扣住。當然,自動糾錯的能力也很關鍵。畢竟是模型嘛,高精度任務確實沒法追求把把zero-shot,還是得靠Loop保證穩定性。柔性物體則更需要自動糾錯了。比如這個削黃瓜的demo,一刀下去,黃瓜形態會變。模型需要實時閉環調整。刀深幾分、力道幾何,如何削得乾淨又不傷果肉……全在毫釐之間的拿捏。你以為黃瓜到這就完成它的使命了?不,原力靈機還在繼續鞭打黃瓜(bushi)。但這次側重點有所不同,是用靈巧手切。模型通過後訓練駕馭高自由度,也是對DM0.5泛化性的展示吧。3、長程穩定高節拍。從這開始,demo就和場景緊密結合起來了。
今年北京亦莊的WRC,原力靈機將快遞流水線搬到了現場,直擊物流中轉站最大痛點—— 單件分離。傳送帶不停,每個包裹的尺寸、材質、擺放姿態都不一樣,傳統機械方案根本幹不了這類任務。DM0.5不依賴預設腳本,純靠實時視覺識別和決策,平均3秒一單,準確率超99%。上週我也是在現場近距離看過這個demo的。說實話,論論情緒價值,我個人覺得還得是工業場景,超解壓啊,跟看清潔直播一樣。至少是能看得下去的,不會慢的要死,撿個枕頭都一卡一卡的。。。ADHD患者強推打卡(bushi)。4、抗干擾。真實世界不是實驗室,相機隨時可能驟變視角,人類隨時可能「空降」搗亂。DM0.
5的解法是分層雙系統,即業界主流的System1與System2架構。Sys2是深思熟慮的高階大腦。負責理解、拒絕與大局預判,劍指zero-shot; Sys1則是動作專家網絡。就像人類的直覺反射,負責handle長程複雜任務中的瑣碎細節。在這套架構加持下,即便外部視點劇烈變化,DM0.5通用Picking的魯棒性依然極強。哪怕人類強行打斷任務,機器人也能準確理解當前實際狀態,自適應修正後續動作。六類場景,從毫米級到傳送帶,從剛性到柔性,從執行到模仿。同一個模型在如此差別很大的場景中都表現優秀,是很少見的。現在大家都衝百萬小時數據,但光看數據量,或許並不符合第一性原理。
如果基模沒有強泛化,每個場景都單獨訓一個模型,demo再多,也不過是一堆散落的珍珠。偏科是沒法的Scaling Up的。這也是我覺得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看見,並且上限可以做到很高。數據、架構、效率全面升級 說了這麼多,原力靈機究竟是怎麼做到的?這方面,團隊也早把他們的經驗,毫無保留地全盤托出了。答案分為三層,也是具身繞不開的三個核心變量:數據、架構、延遲。先看數據。數據決定智能上限,這也是整套具身工程中,最重要的一環,沒有之一。DM0.5的數據資產,主要分為三類。1、真機:5萬小時高精度操作,覆蓋100+種豐富動作,實現秒級精細指令動作對齊。
2、Ego:10萬小時場景視頻,支持毫米級高精度3D Landmark生成,實現精準標註。3、仿真:100萬平空間數據建模複雜室內環境,高精度重建解決Sim2Real Gap。感覺他們還是把質量看的很重的,不是光腦門一拍硬採。數據量的方式則用omni融合思路解決,也是目前行業比較主流的方案,風險最小化。再看架構。一句話總結,DM0.5主要有三大創新,對應解決三個問題。1、怎麼記得住?這個前面提到過,為了降低DM0.5的落地門檻,原力靈機引入了原生長記憶。具體而言,團隊在上下文抽象層做了大量工作,通過高效的信息壓縮技術,讓4B參數的VLM在預訓練階段就能原生學習並記住歷史信息。2、怎麼看得懂?
對此,原力靈機有這麼一個判斷: 沒有語言能力的VLA,就是數據集復讀機。畢竟不管怎麼說,語言確實是最方便蒸餾人類思考能力的模態了,有Language這一層賦能,就是很吃香。於是有了具身思維鏈任務。為此,DM0.5設計了具身思維鏈任務,用11項推理任務驅動模型,對指令、本體、環境進行三方聯合建模,賦予動作生成以語義理解和世界預判能力。這個過程中,團隊可以構造了「反事實任務」,故意給出錯誤指令,迫使模型真正「看懂」而非機械匹配。3、怎麼對得齊?傳統動作監督是對點式的,預測軌跡與真值軌跡之間的偏差會不斷累積,最終炸掉。
原力靈機做的事對齊式的動作監督,利用約束動態規劃高效計算最優匹配,一次性解決動作軌跡不一致的問題。數據和架構雙劍合璧,大幅提升了DM0.5的智能上限。但真正要能用,還得看效率。具身最終是要在端側實時跑的。推理不夠快,參數就是坨廢紙。為此,原力靈機做了一系列優化,這裡就不多做贅述,大家可以直接看官方技術報告。最後成果如下—— 模型核心延遲:534.04 ms → 57.49 ms 累計加速:9.29× 延遲降低:89.2% API 延遲:p50 67.75 ms,p90 70.01 ms LIBERO 成功率:98.45% → 98.40% 硬生生加速了一個數量級啊。。。而且,精度基本無損。
可以說是讓整套VLA推理系統超進化了。登頂,是為了下山 「登頂」確實很驚豔,但說實話,這可能真還不是最值得關注的事情。具身天上一天地上一年,冠軍頻繁易主,僅僅是成績單,很容易過期。真正能在具身週期裡刻下痕跡的,是登頂之後,你願意留下什麼。這可能也是DM0.5選擇全面開源原因。不僅僅是模型權重,DM0.5的訓練框架、下游任務工作流……已陸續在GitHub與Hugging Face開放,供開發者復現、魔改、擴展。比如下面這個demo,就是原力靈機基於DM0.5,結合開源機械臂套件,監督微調出來的。
LLM領域,開源早不是啥新鮮詞,從最開始的DeepSeek,到如今的GLM、Kimi、MiniMax……大家早已習慣了開源的聲音。但在具身行業,我覺得,這件事的意義真不太一樣。物理AI實在太早期,太不成熟了,這點是事實。所以,我們需要更透明的討論,更真實的評測,更多公開的工作…… 如果谷歌當年沒有放出Transfomer,OpenAI或許永遠也摸索不出通往ChatGPT的路。RoboDojo的火爆,推動了評估從「單點Demo展示」走向「標準化全科考試」。讓具身真的可以被統一度量、被複現、被挑戰。DM0.5的登頂與開源,則進一步兌現了這個Benchmark的價值。
讓所有人看到登頂的方法論,也讓方法論可以被帶走、被複用。這是原力靈機對當下這場具身競賽的回答。登上珠峰,從來不是為了留在山頂。下一步,是下山—— 用開源賦能生態,讓第一梯隊的具身大腦,走進各行各業的流水線。GitHub:https://github.com/dexmal/opendm Hugging Face:https://huggingface.co/Dexmal/DM05 Tech Blog:https://www.dexmal.com/blog/dm0.5 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

WRC 2026|生數科技發佈最新研究成果,提出通用世界模型五級發展路線
WRC 2026 期間,生數科技發表最新研究成果,正式提出通用世界模型的五級發展路線。這項研究以階段化架構界定通用世界模型的能力演進,為該領域提供一套可供對照的技術框架。 生數科技此次發布的五級路線,將通用世界模型的發展劃分為依序推進的多個層級,每一層級對應不同的技術課題與能力範疇,共同構成完整的發展藍圖。透過明確的階段劃分,這項成果有助於外界更清楚地理解通用世界模型的發展脈絡,也具體反映出生數科技在該領域的持續投入。 相關成果已在 WRC 2026 期間對外公開,關於五級路線的具體內涵與後續研究規劃,仍有待生數科技進一步揭露。

高盛合夥人警告:華爾街普及 AI 或削弱金融從業者思考能力
作者:遠洋 責編:遠洋 評論: 8 月 25 日消息,高盛負責一項旗艦人工智能項目的合夥人警告稱,AI 在華爾街的快速普及可能削弱下一代金融從業者的思考能力。“這裡存在一個巨大的風險:在 AI 時代,我們把推理能力外包給這些模型,最終出現認知能力萎縮,以至於我們自己都無法再從第一性原理出發進行思考。
Lady Gaga男友低調佈局:用“活體皮膚”訓練AI,這家生物初創公司如何顛覆美妝研發?
發布於AI新閒資訊時間 :Aug 25, 2026閱讀 :1分鐘在硅谷的聚光燈之外,有一家名為 Outer Biosciences 的生物科技初創公司正在悄悄改變美妝與醫療研發的底層邏輯。它的聯合創始人正是知名歌手 Lady Gaga 的伴侶邁克爾·波蘭斯基(Michael Polansky)。

Arm物理AI高管談機器人挑戰:模型只是起點,泛化能力才是突破口
(公眾號:zhidxcom) 作者 | ZeR0 編輯 | 漠影 8月24日報道,8月21日,在世界機器人大會WRC 2026開發者日上,Arm物理AI機器人技術研究全球負責人Federico Pecora發表主題演講,分享了對物理AI從“能力堆疊”走向“系統級自適應”的行業思考。 ▲Arm物理AI機器人技術研究全球負責人Federico Pecora 發表主題演講 過去幾年,機器人在感知、認知和運動控制等領域取得了顯著進展,應用邊界不斷拓展。

一篇論文改寫AI科研評價規則!中國公司拿出實踐數據,雙榜第一
公司Discovery Loop。 同樣是今年,OpenAI、Anthropic、英偉達等科技巨頭相繼官宣入局AI4S這一方向。 這批“跨界”大廠玩家的目標高度一致:不只做科研輔助工具,而是打造能自主跑完“假設→設計實驗→執行驗證→迭代優化”完整科研循環的“AI科學家”。 不只這些科技巨頭,有許多公司已經更早入場。成立於2024年的中國企業深度原理,是全球最早押注AI自主科研方向的公司之一。 這一賽道背後是一片廣闊的“金礦”。

消息稱蔚來智駕負責人任少卿創立具身智能公司,蔚來將戰略投資
作者:沁滄(實習) 責編:沁滄 評論: 8 月 24 日消息,據晚點 Auto 消息,8 月 24 日,蔚來 CEO 李斌在智駕全員會上宣佈,智能駕駛負責人任少卿已創立物理 AI 基礎模型和具身智能獨立公司,蔚來將戰略投資並與之開展合作。知情人士稱,“會議很簡短,沒有提及組織架構變動。