理想世界模型交卷:可以預測觸覺,評測拿下多個第一
機器人前瞻(公眾號:robot_pro) 作者 | 鍾宸 編輯 | 漠影 機器人前瞻9月22日報道,昨日,理想Foundation Model團隊正式發佈世界動作觸覺模型ME-Dex-1.0(MachEmbodied-Dex-1.0)。該團隊稱,其在仿真與真機平臺上評測ME-Dex-1.0,RoboTwin Clean-only Avg.成功率為78.9%,領先最強對比基線7.6個百分點,11項聯合訓練任務的總體成功率為65.3%,比DECO高8.9個百分點。ManiFeel平均成功率為70.0%,比官方基線高15.0個百分點。ME-Dex-1.
0將觸覺從輔助條件提升為未來世界中需要預測的組成部分,統一觸覺表徵負責對齊異構傳感器,三專家架構把預期視覺變化和接觸動態連接到動作生成,數據引擎則通過規模化提供同步監督。理想團隊指出,這些組件共同為更具接觸感知能力的機器人操作提供了一條可行路徑。一、展示仿真與現實環境任務能力,實現觸覺可視化 理想通過相機觀測與觸覺圖共同展示了執行過程中接觸位置和受力模式的變化,視頻覆蓋DexJoCo、RoboTwin仿真環境中的夾爪與靈巧手,以及LeRobot SO-101 PX、Xynova Flex2兩套真機系統。
在RoboTwin仿真環境中,夾爪緩緩下放,夾住了一個長方形盒子,隨即右側的觸覺圖發生了明顯變化。而在DexJoCo仿真環境中,靈巧手完成了拿起物品放入籃子、拿起木棍插入洞中的操作,但是為五倍速播放,整體用時可能比視頻展現的時間更長。而在真機環境下,搭載ME-DEX-1.0的Xynova Flex2靈巧手先是將手腕扭向下方,按壓抽紙的一側使其翹起,再執行抓起的操作,並最終將抽紙“扔”進方盒中,旁邊的觸覺圖也換成了類似人手的形狀,每一個區域還會隨著操作不同出現具體數值的變化。理想也展示了搭載該模型的LeRobot SO-101 PX夾爪夾取藥瓶的視頻。
從視頻來看,整個停頓較多,雖然經計算,整個流程僅有13秒鐘,但視頻右上角同樣標註為五倍速播放,可能實際總耗時已達一分鐘。二、使用仿真數據訓練,採用三專家架構 那麼,這一模型是如何實現這一切的?理想透露,ME-Dex-1.0不只把觸覺作為當前條件輸入,而是將其與視頻共同視為需要預測的未來世界狀態。給定任務指令、當前圖像、本體狀態和觸覺觀測,該模型會聯合去噪未來視頻latent、未來觸覺latent與動作序列。理想表示,這一設計將場景變化和接觸動態直接連接到機器人控制,同時還能夠保留各模態的專屬表達。
理想也承認目前觸覺數據十分稀缺,因此,該公司以自主式觸覺數據引擎(Agentic Tactile Data Engine)擴展RoboTwin與DexJoCo的數據,通過以下兩種方式進行: 回放已有示範動作,讓仿真力傳感器補錄對齊的觸覺信號; 生成並執行新軌跡,擴大任務與接觸模式的覆蓋範圍。理想表示,生成的數據窗口包含同步的當前觀測,以及未來視頻、觸覺與動作目標,可直接用於聯合學習。而因為觸覺數據來自於異構夾爪、靈巧手,理想稱,ME-Dex-1.
0將來自真實與仿真環境的夾爪、靈巧手觸覺數據,映射到受人手結構啟發的雙手34區域模板,並通過區域掩碼(mask)區分“該區域不可觀測”和“已觀測但未接觸”,避免混淆缺失值與零受力。此後,該公司通過共享編碼器提取局部力模式,將其匯聚為標準區域token,並通過masked Transformer交換信息,解碼器則用於重建力場與接觸概率。在訓練中,理想會結合使用力、接觸、時序變化和latent正則損失,從而在緊湊的latent空間中保留力大小、接觸的支撐與過渡(force magnitude, contact support and contact transitions)。
模型架構上,理想採用了三專家模型的架構,通過視覺專家建模未來場景變化,觸覺專家用於預測具有空間結構的接觸動態,動作專家則生成可執行的動作序列。其透露,三個Transformer均採用條件Flow Matching優化,同時保留獨立參數與隱藏維度。該公司還採用H-Bridge共享注意力的結構技巧。跨模態交互會集中發生在選定的中間層,視覺、觸覺與動作token會被投影到兼容的注意力空間完成信息交換,再返回各自的專家模型,淺層和深層則保持模態專屬處理,在控制計算量的同時建立有效協同。同時,通過聯合訓練與推理,未來視頻、觸覺和動作目標會分別加入噪聲並聯合去噪。
推理時,三類輸出從高斯噪聲出發,在當前觀測條件下同步演化。最終動作序列則用於機器人控制,視覺與觸覺解碼器則恢復對應的未來觀測。三、評測領先基線,11項任務7項排第一 理想還在仿真平臺上評測了ME-Dex-1.0。RoboTwin使用覆蓋50項聯合訓練任務的27,500條Clean與Random軌跡,並額外以2,500條Clean軌跡評估跨配置泛化;DexJoCo包含6 項單臂、5項雙臂任務共1,100條示範;ManiFeel則通過四項插入任務評估三維觸覺力建模。真機部署評測則覆蓋了LeRobot SO-101 PX夾爪與Xynova Flex2靈巧手的任務執行。
結果顯示,在混合訓練設置下,RoboTwin加入當前觸覺條件後,Random成功率由86.90%提升至89.54%;進一步加入預測未來觸覺(future tactile prediction)後,成功率達到90.60%,H-Bridge共享注意力的加入最終將成功率提升至91.92%。將當前觸覺輸入置零時,完整模型仍在Clean/Random上取得91.70%/91.74%的成績,理想指出,這說明增益也來自觸覺監督與未來觸覺預測,而非僅依賴當前觸覺的觀測。ME-Dex-1.0在DexJoCo的11項任務中,有7項排名第一,五項雙臂任務平均成功率達到48.8%,高於DECO與DECO.p的39.
6%。在ManiFeel上,相比官方基線,該模型在四項任務中的三項實現領先,其中電源插頭插入的成功率由58.0%提升至88.0%。理想還進行了定性分析,稱該模型相比對比模型效果更好。在RoboTwin中,ME-DEX-1.0可以在兩個基線模型失敗的情況下,完成抽屜放置和物體掃描的任務。而在DexJoCo中,理想稱,ME-Dex-1.0在插銷裝配和iPad密碼輸入任務上,展現出了更有效的雙手協同。理想還展示了下一階段將聚焦的研究與目標: 擴大觸覺預訓練:後續將擴展跨平臺觸覺數據,並評估模型對未知傳感佈局與機器人本體的泛化能力。
更快的接觸反饋:未來將研究觸覺驅動的局部反饋控制,通過在執行過程中進行高頻修正,提升精細操作的響應速度與準確性。結語:觸覺不止於標配,或將成為模型預測的一部分 過去兩年,VLA模型讓機器人”看懂”了世界,但操作的成敗往往藏在指尖。ME-Dex-1.0的思路是:未來視頻可以預測,未來觸覺同樣可以預測,而且預測的不是抽象數值,而是接觸動態如何連接到下一步動作。結果驗證了這條路,這一模型在評測結果上展現了領先水平。但是,這並不代表世界模型解決了觸覺預訓練規模、跨平臺泛化、真機實時性等問題,具身大模型的競爭,正從眼睛和大腦卷向“指尖的觸覺”。
讓模型主動預測接觸而非被動接收觸覺,很可能成為下一代世界-動作模型的標配。arXiv論文鏈接:https://arxiv.org/pdf/2609.21449 技術博客鏈接:https://machembodied.com/ME-Dex/ME-Dex1.0.html#model GitHub鏈接:https://github.com/MachEmbodied/ME-Dex-1.0
Related
相關文章

成為AI原生的超級組織:讓每一次工作,都成為下一次的積累|2026 ITValue Summit數字價值年會
TechPulse2026.09.22 16:25 · 來自浙江全文3008字00:00 / 09:24模型能力如何變成企業自身的能力?一個人的效率提升,又如何沉澱為整個組織的積累?品勝的AI團隊進入業務部門時,第一件事是把工位搬過去,和業務同事一起辦公。

OpenAI內部AI已能自主訓練模型,奧特曼發佈全球安全倡議應對RSI逼近
多個智能體自發協作完成相關工作,把原本漫長的實驗耗時大幅壓縮,甚至還能自己動手編寫用於優化GPU內核的程序——在OpenAI看來,這正是遞歸式自我提升(RSI)的雛形。面對這股正在加速的勢頭,OpenAI拋出了全球安全倡議。公司明確指出,全自主的RSI尚未真正發生,但進程正在提速;一旦缺乏管控,人類有可能徹底失去對AI發展的實際控制。

阿里千問辦公發佈企業上下文、數字員工及 Agent 硬件 QwenNote A2
作者:遠洋 責編:遠洋 評論: 9 月 22 日消息,在今天舉行的 2026 雲棲大會千問辦公專場上,阿里千問辦公(QwenWork)圍繞企業級 Agent 發佈了一系列產品與能力升級,主題指向“讓企業級 Agent 懂業務、能協同、信得過”。

中國聯通中訊院發佈量子安全手機 2.0:基於國產主流旗艦手機深度定製,搭載端側離線安全風控 AI
作者:汪淼 責編:汪淼 評論: 9 月 22 日消息,在本月的 2026 中國聯通合作伙伴大會上,中國聯通旗下中訊郵電諮詢設計院有限公司(以下簡稱“中訊院”)正式發佈量子安全手機 2.0。該產品在 2025 年 5 月發佈的首款量子安全手機基礎上實現全方位能力升級,面向黨政、紀檢監察、央國企、金融等高安全需求場景,提供從終端、業務到管理的全鏈路移動安全防護。

前 xAI 員工創業開公司打擊深度偽造,尋求 5000 萬美元種子輪融資
作者:清源 責編:清源 評論: 9 月 22 日消息,據彭博社今天(22 日)凌晨援引知情人士消息稱,先後在谷歌、xAI 任職的蒂娜 · 奧貝羅伊計劃創辦一家專門應對網絡深度偽造的新公司,並就約 5,000 萬美元(注:現匯率約合 3.36 億元人民幣)種子輪融資與投資者展開洽談。

SpaceXAI 最強模型 Grok 4.7 上線:長任務能力拉滿,價格只有旗艦一半
發佈頁開頭只有一句極具“攻擊性”的定位:面向編程與知識工作的最強模型,速度達可比模型兩倍,價格僅一半。這次升級沒有停留在跑分表上——Grok4.7換用更大的基礎模型,強化長時間任務、自我檢查和長上下文管理,並把文檔、演示、法律、醫療和工程等專業工作納入重點測試,目標是讓模型在持續數小時的任務裡少走彎路、交出可直接使用的結果。