具身智能的無本體數據,終於有了自己的「代表作」

2026年9月30日 03:53
站內 AI 整理稿

無本體數據跑通複雜長程任務的時刻,到了。作者丨向 欣 編輯丨高景輝 最近,自變量機器人發了一段Demo。看完之後我們的感覺是:無本體數據路線要迎來一個重要的里程碑了。畫面裡,一個機器人獨立完成了開瓶取樣、滴管操作、玻璃棒引流、混合搖勻,24個子動作,一鏡到底做完了整場化學實驗。這裡的重點是,用於訓練它的數據,只有數百條,而且全部都是無本體數據,沒有一條來自機器人真機。也就是說,自變量只用極少的無本體數據,就讓機器人學會了需要精準力控和雙手協同的長程操作。

視頻背後的系統是自變量最新發布的TwinDEX,它由一套可穿戴的無本體數據採集系統和一套與之匹配的機器人末端執行器組成,中間配套完整的數據處理和策略訓練流程。評測顯示,TwinDEX訓練模型時無本體數據近乎可 100% 完全替代真機遙操作數據。其中含金量不言而喻,機器人越是追求精細、複雜的靈巧操作,對訓練數據的質量和規模要求就越高。過去幾年,靈巧操作被公認是具身智能裡最難啃的一塊骨頭。

而數據採集始終面臨兩難:遙操作雖然採出來的數據和機器人本體天然匹配,但成本高、速度慢,規模化極難;用視頻、手套等輕量方式採集人類示範雖然能把成本壓下來,卻又繞不開一個老問題:人採到的東西,和機器人真正需要執行的動作常常對不上號。這也塑造了具身智能領域的「數據金字塔」:真機遙操作數據因包含豐富的真實物理交互信息,被視為價值最高的數據類型,但同時也是最難規模化獲取的數據。TwinDEX則提供了另一種可能——通過提高數據採集端與機器人執行端的一致性,讓無本體數據也能夠獲得接近真機數據的訓練效果,為靈巧操作的數據規模化提供了新的方法。

而且,TwinDEX並不只是單純地讓採集端和執行端保持「同構性」,而是從「純無本體數據訓練」的目標出發,反向協同設計了硬件、訓練和執行系統,讓數據從產生之初就符合機器人執行需求,無需複雜遷移即可用於訓練和部署,採集也擺脫了機器人本體和固定場地的限制。這麼看來,自變量是把數據採集的邏輯,重新定義了一遍。0124個動作一鏡到底,「最強」demo用了「最少」的數據先看這套系統究竟讓機器人做了什麼。這場實驗包含24個子動作,流程大致經過開瓶取樣、滴管與試管操作、玻璃棒引流、搖勻觀察。整段演示有三個關鍵詞:長任務、雙手協同、連續工具切換。

此前行業裡的靈巧手演示,多是抓起一個物體、放進一個盒子,動作鏈條短,容錯空間大。而這次自變量展示的是長程任務。長程任務的難點在誤差累積:24個動作連成一條鏈,每一步都要求毫米級定位與穩定力控,任何一步的微小偏差都會被後續步驟放大,前一步歪一毫米,後面灑掉的可能就是半勺粉末。能一鏡走完,說明系統的閉環修正能力足夠穩定,全程都沒有崩。其中幾個動作尤其能說明這套系統的操作能力。第一處難點是開瓶和取樣。旋開瓶蓋這個動作的技術亮點在於旋擰依賴的是手指的側擺自由度,而不是手腕旋轉。把瓶蓋擰鬆再旋下,手指需要在接觸瓶蓋的同時產生側向運動。

人手旋蓋時,拇指和食指形成對向接觸,指腹與瓶蓋之間的摩擦力提供旋轉所需的切向力。但機器人要復現這個動作,側擺關節必須產生足夠的位移和力矩,接觸點要避免滑移,旋鬆過程中還要從強力抓握過渡到更柔性的控制。很多靈巧手能握住瓶子,但沒法讓手指在保持接觸的同時橫向移動,這個差距,就是「能抓」和「能操作」之間的分界線。藥勺取粉則是另一個維度的難度。藥勺柄細,瓶口窄,機械臂要把勺尖精準探入瓶內,舀取粉末後再平穩抽出,全程不能碰撞瓶口、不能灑落。狹窄空間裡的精細定位、避障和穩定取料,三者疊加,對空間精度的要求極高。藥勺進入瓶口後,視覺基本被遮擋,後續操作依賴的是運動規劃和接觸感知。

系統必須在缺乏持續觀測的情況下完成精細接觸操作,這在機器人領域屬於難題。第二處難點是滴管操作。滴管需要經歷抓取、擠壓、出液和釋放幾個連續狀態。位置偏差可以通過視覺判斷,擠壓力度卻很難單靠圖像確定。這個任務真正難的地方在擠壓環節。力度太小,液體排不出來;力度太大,液滴飛濺。滴管是彈性物體,擠壓過程中的力反饋是非線性的,前半段和後半段的阻力完全不同。這種情況下,力度控制不是靠位置規劃能解決的,需要在接觸發生後持續調節輸出。機器人還要完成換手、取試管、倒液等連續操作。換手意味著兩隻手之間的協調配合,倒液涉及腕部姿態與液體流向之間的關係。靈巧操作真正的難點,正在於接觸發生之後還要繼續控制力。

第三處難點是玻璃棒引流。一隻手需要把透明玻璃棒壓在燒杯內壁並保持位置,另一隻手拿起水杯緩慢傾斜,讓液體沿玻璃棒流入燒杯。兩個接觸關係必須同時成立:玻璃棒與杯壁之間的接觸,液流與棒面之間的接觸。任何一側的力或位置偏移,都會導致液體溢出。仔細拆解這個動作。玻璃棒透明,視覺系統很難精確感知它的位置和姿態。機器人需要在視覺信息不完整的情況下,通過接觸力來判斷玻璃棒是否貼緊了杯壁、是否穩定。傾倒的那隻手則需要根據液流速度動態調節傾角,這個調節過程沒有確定的公式可以套用,每一步都依賴對當前狀態的實時評估。兩隻手同時維持接觸約束時,任何一隻手的誤差都會直接傳導到另一隻手。

右手調整傾角時產生的力變化,通過燒杯傳遞到左手拿的玻璃棒上,如果左手的力控不夠穩定,玻璃棒就會滑動。把這個動作做出來,比做十個抓取放置加起來都難。回到這個Demo真正證明了什麼,可以總結成三點。其一,誤差沒有隨任務變長而失控,說明閉環修正能力穩定,系統經得起長鏈條的考驗。其二,滴管擠壓、玻璃棒引流這類動作,人類都要靠指尖的即時手感來調整,機器人做到了,說明觸覺和力控信號真正被有效利用,模型沒有在靠視覺盲操。其三,也是最有說服力的一點:訓練全程零真機數據。最難的任務完全由無本體數據撐了起來,等於給「同構採集」這套方法論做了一次最苛刻的壓力測試。

可以說,這個Demo挑選的任務,屬於最容易暴露問題、也最難偽裝成功的那一類。任務越長,接觸越多,工具切換越頻繁,系統留下的容錯空間就越小。能把這些環節連續完成,才足以說明它具備穩定的精細操作能力。02讓數據與機器人完全匹配,將遷移難題「扼殺在搖籃裡」要理解 TwinDEX,首先需要把它看成一套完整的數據系統,而非單獨的一套硬件。它從一開始就是為純無本體數據訓練設計的,「同構」是核心設計原則,硬件形態、數據採集和訓練方式都由這一目標倒推而來。TwinDEX的優點可以概括為三個詞:靈巧性、一致性、可拓展性。靈巧性是入場券,一致性是核心,可拓展性決定上限。先說靈巧性。

TwinDEX的三指靈巧手具備九自由度,其中七個為主動自由度。這個構型是剋制的選擇。自變量建立了覆蓋多類元操作的靈巧性基準來評估構型,最後發現,拇指、食指和中指協同起來,已經能覆蓋大多數常見操作,既能配合足夠好的模型,也可以完成複雜的靈巧操作。一致性是重點,體現在三個層面。第一個層面,是數採硬件與機器人本體的一致。行業的常見困境是,採集設備與機器人結構不同,數據要經過複雜的運動重定向和視覺遷移才能使用,關鍵信息容易在轉換中丟失。

TwinDEX的做法是在硬件層面取消這道轉換:在運動學上保持自由度、關節軸和連桿比例一致;在接觸力學上保持接觸材料、幾何和表面特性一致,並配置對應觸覺傳感器;在視覺上保持外觀一致。第二個層面,是數據本身的一致性,自變量針對關節、手腕定位、抖動和漂移等關鍵精度指標進行優化,降低關節、手腕定位以及長時間採集中的抖動和漂移。第三個層面,是訓練與執行的一致性。針對無本體採集容易受到場地變化、座標系和標定誤差影響的問題,自變量也對訓練和控制方式進行了相應設計。比如雙手協作時,模型重點學習的是兩隻手之間的距離、方向和姿態,而不是它們在空間中的絕對位置。

這樣換一張桌子、換一個操作者,雙手之間的協作關係仍然成立。模型對場地變化適應能力更強。可拓展性解決的是規模問題,無本體加可穿戴,讓數據生產擺脫機器人本體。具身模型的訓練分預訓練和後訓練兩段,後訓練一般依賴真機數據微調,而真機數據離不開本體和場地,規模越大越是瓶頸。TwinDEX讓數據採集可以不再需要機器人本體:一套可穿戴外骨骼,一個人、一張桌子,就是一個數據採集單元,能帶進辦公室、廚房、工位,多人多地點並行開工。穿戴式還保留了人類最自然的控制閉環:看得到物體、感受得到接觸,可以即時調整動作,接觸密集任務的數據質量因此更高。這一通設計最終落到了兩個結果上:無本體數據的訓練效果,以及它的生產效率。

自變量此前的數採方案裡,無本體數據與真機數據按10:1混合即可媲美全真機訓練。而這一次,多任務測試進一步顯示,隨著數據量增加,純無本體數據訓練出的策略與真機數據訓練的策略表現幾乎同步提升,並最終達到相近水平,意味著無本體數據在訓練效果上幾乎可以 100% 替代真機遙操作數據。在數據生產端,TwinDEX的優勢更加明顯:一套可穿戴設備就能替代機器人本體成為採集單元,相關任務的數據採集效率達到真機遙操作的 5.3 倍。數據價值接近真機,生產又擺脫真機,這才是TwinDEX真正想解決的問題:讓高質量的機器人數據,既能採得出來,也能規模化生產。

03具身智能的「數據金字塔」,正在發生傾斜機器人數據的矛盾正在發生變化。具身智能的數據結構常被描述成金字塔:底層是互聯網視頻與仿真,中層是Ego、UMI 等主動採集式無本體數據,頂層是真機數據。眼下趨勢是大量使用無本體數據,少量真機只做錨定,比例甚至到90%比10%。原因不難理解:本體昂貴,遙操作把機器人、場地、操作員綁在一起,規模一擴大就成了瓶頸;模型對大規模、多樣化真實數據的需求還在增長,robot-free由此成了熱詞。目前比較典型的無本體數據路線,大致可以分成兩類。第一類是人類視頻或第一視角視頻。優勢是便宜、容易規模化,卻缺少精確的手指運動、接觸和力信息。

第二類是手套、外骨骼等可穿戴設備以及 UMI。但採集端與機器人之間仍然存在運動學、接觸力學、視覺和時序上的差異。現有方案普遍面對四個gap:運動學結構不同的kinematic gap;接觸力學信息缺失的contact gap,最容易被忽視也最致命,「看起來正確」的動作遷移過去仍會失敗;採集畫面與部署畫面不一致的visual gap;多模態信號彼此錯位的temporal gap。行業已經在針對這些問題尋找辦法,在硬件、視頻渲染、仿真方面都做了嘗試。

▪ 有的方案通過更高精度的傳感器、SLAM和同步技術提升採集質量,實現部分任務零真機後訓練,但複雜遮擋與快速運動場景仍會重建失敗;▪ 有的方案通過視頻編輯、分割和渲染,讓人類視頻裡的手變成機器人手,但複雜接觸場景效果打折;▪ 還有方案藉助仿真補足真實數據裡缺失的接觸信息,可力學信息仍然不夠準確,更多靠仿真去猜;▪ 也有研究嘗試依靠更大規模的模型和預訓練數據,讓模型自行學習跨本體對應關係,但湧現依賴大模型,仍需真機兜底。這些方案雖然路徑不同,但都在解決同一個問題:如何在低成本和高質量之間找到平衡。這也是靈巧操作長期存在的「不可能三角」——數據質量、操作靈巧性和規模化生產很難同時兼得。

而且,這四類解法的共同特徵,是都發生在數據採集之後:硬件測得更準、算法事後修正、仿真補缺口、模型湧現對齊,都是一種「事後補償」策略。這類研究其實已經說明,行業真正需要解決的問題,已經超出了「怎樣脫離機器人採數據」:採集端和執行端之間如何建立穩定對應關係,或許更為關鍵。04當數據足夠「便宜管飽」,更高層級的智能將成為可能自變量先意識到了這一點,TwinDEX選擇的切入點十分獨特,它從機器人最終的執行效果倒推數據採集端的設計。採集設備與執行設備在結構、接觸、視覺上同構,gap從設計階段就被消除。TwinDEX在全球範圍內首次實現了數據質量、操作靈巧性和規模化生產這三者的結合。

這兩條路線的分野值得多說一句。行業在琢磨如何用算法、仿真、規模把差距填平;自變量的選擇是,從硬件設計的第一天起,就不讓這個差距產生。實際上,自變量其實是改變了數據生產的組織方式。這種領先也體現在系統問題的定義方式上。多數方案先考慮怎麼採數據,再想辦法把數據映射給機器人。但如果採集設備、機器人執行器、數據處理和策略訓練分別優化,最後再通過算法把它們拼起來,那麼每個環節之間都可能產生新的誤差。TwinDEX從機器人最終要執行的效果倒推採集端應該長成什麼樣,把硬件、數據和模型作為一個系統整體設計,而不是把各個環節單獨做到最優再拼接起來。

這樣做的直接結果,是在保證靈巧操作和數據質量的同時,也打開了規模化採集的空間。這套思路還帶來一個值得關注的延伸:數據層和模型層可以進一步解耦。這套系統可以使用自變量自家的 WALL-OSS 開源模型,也可以適配 π0.5 等不同基礎模型。傳統情況下,換模型又可能要重新處理數據接口和訓練流程。而TwinDEX採集端和執行端之間的 embodiment 對齊已經在系統底層完成。即使模型層發生變化,數據和機器人之間的對應關係依然可以保留。換句話說,模型面對的是一套穩定的數據和動作接口,而不需要每換一個模型,就重新解決一次人手與機器人之間的差異。

對開發者來說,不需要被某一個模型綁定,可以自由選用最適合當前任務的模型,或者隨著模型生態的演進隨時升級替換,數據管線不需要跟著重做一套。對落地來說,當下一代模型出現時,已經採集好的數萬條數據資產不會作廢,可以直接用來訓練新模型。數據採集和模型選型可以各自獨立迭代,互不拖累。如果這個方向最終成立,具身數據的價值就可能發生變化。按照自變量的規劃,下一階段的數據採集會進一步走向開放環境和長尾任務,為機器人模型提供更加豐富、多樣的真實世界操作數據。

當這套體系能夠持續運轉,數據規模本身就可能成為機器人能力增長的重要變量:數據越豐富,模型覆蓋的任務和環境越廣;能力提升後,又能夠處理更多過去沒有覆蓋的場景,進一步形成新的數據積累。從這個角度看,TwinDEX真正值得關注的地方,其實不僅僅在於讓機器人少用一些真機數據,更在於它讓具身智能有機會建立一套可以持續擴張的數據生產體系。當靈巧操作的數據積累跨過某個臨界點,機器人獲得足夠豐富、多樣的真實世界操作經驗,更高層次的智能湧現或許也會真正變得觸手可及。這才是自變量做這套系統的終極目的。

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

戴森 AI 電動牙刷 CamaraJet 一度“下架”,官方承認早期批次產品存在滲水故障

作者:清源 責編:清源 評論: 9 月 30 日消息,據彭博社今天(30 日)報道,戴森確認,新推出的 CameraJet 可視成像牙刷早期一個批次因滲水發生故障。這也是戴森首次說明 CameraJet 為何一度從零售渠道消失。CameraJet 售價 499 美元(注:現匯率約合 3,352 元人民幣),通過 AI 和內置攝像頭實時提供刷牙反饋。

剛剛

小米門窗傳感器 3 上架:升級隧道磁阻傳感器、3 年長續航,眾籌價 44 元

作者:遠洋 責編:遠洋 評論: 感謝網友 很宅很怕生 的線索投遞!9 月 30 日消息,小米門窗傳感器 3 已上架,將於 10 月 12 日 10 點開啟眾籌,眾籌價為 44 元,建議零售價 49 元。新品主打“一次安裝、3 年省心長續航”,圍繞門窗、抽屜、櫃門等開合狀態感知,進一步強化家庭安防與智能聯動體驗。

剛剛

報告稱微軟 Copilot 承包商可完整查看用戶上傳的照片、AI 提示詞等

作者:故淵 責編:故淵 評論: 9 月 30 日消息,科技媒體 404 Media 於 9 月 28 日披露一份內部文件,報道稱數百名受僱於微軟的合同工,能夠看到用戶上傳的含有清晰面部信息的照片,以及相關提示詞和 AI 生成的編輯結果。該媒體記者約瑟夫 · 考克斯(Joseph Cox)在調查後指出,這些合同工可以看到用戶上傳的圖片、輸入發送給 Copilot 的原始提示詞,以及 AI 生成的前後版本編輯結果。

剛剛

TrendForce:降容保供難撼緊缺大勢,預計 HBM 均價 2027 年上漲 121%

作者:溯波(實習) 責編:溯波 評論: 9 月 29 日消息,TrendForce(集邦)今日宣佈上調對 HBM 內存 2027 年價格的展望,預計其平均價格將在明年出現 121% 的同比增長。從整體上來看,AI 服務器需求持續擴張,HBM 與通用 DRAM 產品競爭有限產能的情況不會發生改變,而隨著 AI 芯片的迭代升級,均價更高的 HBM4 佔比逐漸提升、HBM4E 也將逐步放量,推動價格上行。

15 小時前

韓漫啟示錄:中國AI漫劇出海正在積聚風險

針尖2026.09.29 10:15 · 來自浙江全文3353字00:00 / 09:24韓國漫畫的全球征程告訴我們,中國AI漫劇90%的渠道壟斷和90%的內容產出不是一件值得欣喜的事,恰恰是風險積聚到一定程度的危險信號。文 | 針尖中國企業正在壟斷海外短劇市場的話語權,AI漫劇強化了這一進程。2026年8月,全球海外短劇APP前十名中有9家屬於中國公司;在這些平臺上播放的AI漫劇,90%以上Made in China。一個“全球分發網絡+本土內容直出”的體系已然成型。

21 小時前