理想世界模型交卷:可以預測觸覺,評測拿下多個第一
機器人前瞻(公眾號:robot_pro) 作者 | 鍾宸 編輯 | 漠影 機器人前瞻9月22日報道,昨日,理想Foundation Model團隊正式發佈世界動作觸覺模型ME-Dex-1.0(MachEmbodied-Dex-1.0)。該團隊稱,其在仿真與真機平臺上評測ME-Dex-1.0,RoboTwin Clean-only Avg.成功率為78.9%,領先最強對比基線7.6個百分點,11項聯合訓練任務的總體成功率為65.3%,比DECO高8.9個百分點。ManiFeel平均成功率為70.0%,比官方基線高15.0個百分點。ME-Dex-1.
0將觸覺從輔助條件提升為未來世界中需要預測的組成部分,統一觸覺表徵負責對齊異構傳感器,三專家架構把預期視覺變化和接觸動態連接到動作生成,數據引擎則通過規模化提供同步監督。理想團隊指出,這些組件共同為更具接觸感知能力的機器人操作提供了一條可行路徑。一、展示仿真與現實環境任務能力,實現觸覺可視化 理想通過相機觀測與觸覺圖共同展示了執行過程中接觸位置和受力模式的變化,視頻覆蓋DexJoCo、RoboTwin仿真環境中的夾爪與靈巧手,以及LeRobot SO-101 PX、Xynova Flex2兩套真機系統。
在RoboTwin仿真環境中,夾爪緩緩下放,夾住了一個長方形盒子,隨即右側的觸覺圖發生了明顯變化。而在DexJoCo仿真環境中,靈巧手完成了拿起物品放入籃子、拿起木棍插入洞中的操作,但是為五倍速播放,整體用時可能比視頻展現的時間更長。而在真機環境下,搭載ME-DEX-1.0的Xynova Flex2靈巧手先是將手腕扭向下方,按壓抽紙的一側使其翹起,再執行抓起的操作,並最終將抽紙“扔”進方盒中,旁邊的觸覺圖也換成了類似人手的形狀,每一個區域還會隨著操作不同出現具體數值的變化。理想也展示了搭載該模型的LeRobot SO-101 PX夾爪夾取藥瓶的視頻。
從視頻來看,整個停頓較多,雖然經計算,整個流程僅有13秒鐘,但視頻右上角同樣標註為五倍速播放,可能實際總耗時已達一分鐘。二、使用仿真數據訓練,採用三專家架構 那麼,這一模型是如何實現這一切的?理想透露,ME-Dex-1.0不只把觸覺作為當前條件輸入,而是將其與視頻共同視為需要預測的未來世界狀態。給定任務指令、當前圖像、本體狀態和觸覺觀測,該模型會聯合去噪未來視頻latent、未來觸覺latent與動作序列。理想表示,這一設計將場景變化和接觸動態直接連接到機器人控制,同時還能夠保留各模態的專屬表達。
理想也承認目前觸覺數據十分稀缺,因此,該公司以自主式觸覺數據引擎(Agentic Tactile Data Engine)擴展RoboTwin與DexJoCo的數據,通過以下兩種方式進行: 回放已有示範動作,讓仿真力傳感器補錄對齊的觸覺信號; 生成並執行新軌跡,擴大任務與接觸模式的覆蓋範圍。理想表示,生成的數據窗口包含同步的當前觀測,以及未來視頻、觸覺與動作目標,可直接用於聯合學習。而因為觸覺數據來自於異構夾爪、靈巧手,理想稱,ME-Dex-1.
0將來自真實與仿真環境的夾爪、靈巧手觸覺數據,映射到受人手結構啟發的雙手34區域模板,並通過區域掩碼(mask)區分“該區域不可觀測”和“已觀測但未接觸”,避免混淆缺失值與零受力。此後,該公司通過共享編碼器提取局部力模式,將其匯聚為標準區域token,並通過masked Transformer交換信息,解碼器則用於重建力場與接觸概率。在訓練中,理想會結合使用力、接觸、時序變化和latent正則損失,從而在緊湊的latent空間中保留力大小、接觸的支撐與過渡(force magnitude, contact support and contact transitions)。
模型架構上,理想採用了三專家模型的架構,通過視覺專家建模未來場景變化,觸覺專家用於預測具有空間結構的接觸動態,動作專家則生成可執行的動作序列。其透露,三個Transformer均採用條件Flow Matching優化,同時保留獨立參數與隱藏維度。該公司還採用H-Bridge共享注意力的結構技巧。跨模態交互會集中發生在選定的中間層,視覺、觸覺與動作token會被投影到兼容的注意力空間完成信息交換,再返回各自的專家模型,淺層和深層則保持模態專屬處理,在控制計算量的同時建立有效協同。同時,通過聯合訓練與推理,未來視頻、觸覺和動作目標會分別加入噪聲並聯合去噪。
推理時,三類輸出從高斯噪聲出發,在當前觀測條件下同步演化。最終動作序列則用於機器人控制,視覺與觸覺解碼器則恢復對應的未來觀測。三、評測領先基線,11項任務7項排第一 理想還在仿真平臺上評測了ME-Dex-1.0。RoboTwin使用覆蓋50項聯合訓練任務的27,500條Clean與Random軌跡,並額外以2,500條Clean軌跡評估跨配置泛化;DexJoCo包含6 項單臂、5項雙臂任務共1,100條示範;ManiFeel則通過四項插入任務評估三維觸覺力建模。真機部署評測則覆蓋了LeRobot SO-101 PX夾爪與Xynova Flex2靈巧手的任務執行。
結果顯示,在混合訓練設置下,RoboTwin加入當前觸覺條件後,Random成功率由86.90%提升至89.54%;進一步加入預測未來觸覺(future tactile prediction)後,成功率達到90.60%,H-Bridge共享注意力的加入最終將成功率提升至91.92%。將當前觸覺輸入置零時,完整模型仍在Clean/Random上取得91.70%/91.74%的成績,理想指出,這說明增益也來自觸覺監督與未來觸覺預測,而非僅依賴當前觸覺的觀測。ME-Dex-1.0在DexJoCo的11項任務中,有7項排名第一,五項雙臂任務平均成功率達到48.8%,高於DECO與DECO.p的39.
6%。在ManiFeel上,相比官方基線,該模型在四項任務中的三項實現領先,其中電源插頭插入的成功率由58.0%提升至88.0%。理想還進行了定性分析,稱該模型相比對比模型效果更好。在RoboTwin中,ME-DEX-1.0可以在兩個基線模型失敗的情況下,完成抽屜放置和物體掃描的任務。而在DexJoCo中,理想稱,ME-Dex-1.0在插銷裝配和iPad密碼輸入任務上,展現出了更有效的雙手協同。理想還展示了下一階段將聚焦的研究與目標: 擴大觸覺預訓練:後續將擴展跨平臺觸覺數據,並評估模型對未知傳感佈局與機器人本體的泛化能力。
更快的接觸反饋:未來將研究觸覺驅動的局部反饋控制,通過在執行過程中進行高頻修正,提升精細操作的響應速度與準確性。結語:觸覺不止於標配,或將成為模型預測的一部分 過去兩年,VLA模型讓機器人”看懂”了世界,但操作的成敗往往藏在指尖。ME-Dex-1.0的思路是:未來視頻可以預測,未來觸覺同樣可以預測,而且預測的不是抽象數值,而是接觸動態如何連接到下一步動作。結果驗證了這條路,這一模型在評測結果上展現了領先水平。但是,這並不代表世界模型解決了觸覺預訓練規模、跨平臺泛化、真機實時性等問題,具身大模型的競爭,正從眼睛和大腦卷向“指尖的觸覺”。
讓模型主動預測接觸而非被動接收觸覺,很可能成為下一代世界-動作模型的標配。arXiv論文鏈接:https://arxiv.org/pdf/2609.21449 技術博客鏈接:https://machembodied.com/ME-Dex/ME-Dex1.0.html#model GitHub鏈接:https://github.com/MachEmbodied/ME-Dex-1.0
Related
相關文章

SpaceXAI 最強模型 Grok 4.7 上線:長任務能力拉滿,價格只有旗艦一半
發佈頁開頭只有一句極具“攻擊性”的定位:面向編程與知識工作的最強模型,速度達可比模型兩倍,價格僅一半。這次升級沒有停留在跑分表上——Grok4.7換用更大的基礎模型,強化長時間任務、自我檢查和長上下文管理,並把文檔、演示、法律、醫療和工程等專業工作納入重點測試,目標是讓模型在持續數小時的任務裡少走彎路、交出可直接使用的結果。

亞馬遜開始成為Kimi的印鈔機
字母榜2026.09.22 14:59 · 來自北京全文3178字00:00 / 09:33AWS已接入K3,智譜也開始和海外雲廠商分錢了。文 | 字母榜一個月前,月之暗面同時找上微軟、亞馬遜和谷歌,希望讓K3進入Azure、AWS和Google Cloud,並從相關服務產生的收入裡分走一部分。

阿里千問平板 QwenBook 演示真機首秀:搭載小背屏,鍵盤有千問專屬鍵
作者:汪淼 責編:汪淼 評論: 9 月 22 日消息,《晚點 LatePost》今日報道稱,阿里雲旗下無影團隊正在研發一款名叫 QwenBook 的 AI 設備,定位是原生智能體電腦,但產品形態更接近一臺“千問平板”,團隊計劃在 2026 雲棲大會上展示 QwenBook 演示版本。

華為小藝 App 獲 11.7.8.215 版本邀測升級,小藝 Claw 升級為小藝 Work
作者:歸瀧 責編:歸瀧 評論: 感謝網友 憨色的毛怪 的線索投遞!9 月 22 日消息,華為小藝 App 昨日在華為應用市場(App Gallery)開啟了 11.7.8.215 (110708215) 版本邀測升級(需收到短信通知後點擊鏈接跳轉安裝),測試時間為 2026/9/21-2026/9/30。

曝阿里試水千問平板 QwenBook:定位原生智能體電腦,主打辦公、打通 WPS
作者:汪淼 責編:汪淼 評論: 感謝網友 HH_KK 的線索投遞!9 月 22 日消息,據《晚點 LatePost》今日報道,阿里雲旗下無影團隊正在研發一款名叫 QwenBook 的 AI 設備,定位是原生智能體電腦,但產品形態更接近一臺“千問平板”,產品定義和硬件部分由團隊自研,無影過去做雲電腦積累的系統和端雲能力,也被帶進了這個項目。

千問 AI 眼鏡 N1 系列亮相阿里雲棲大會:支持眼動追蹤與虹膜支付,10 月 13 日發售
N1 Pro 及千問 AI 耳夾式耳機。三款新品已開啟線上預約,並將於 10 月 13 日現貨發售。據官方介紹,N1 系列搭載 5000 萬像素傳感器,支持第一視角拍攝。其中,N1 Pro 支持眼動追蹤和虹膜支付。用戶看向展品並提問時,AI 可藉助視線信息判斷用戶所指對象。