李飛飛、吳佳俊再聯手,打破世界模型和機器人動作的「巴別塔」

2026年9月1日 02:56
站內 AI 整理稿

視覺軌跡充當“同聲傳譯”,讓世界模型和機器人動作真正“同頻對話”。作者丨幸麗娟 編輯丨岑 峰 日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的論文悄然上線 arXiv。論文署名中出現了兩個大家很熟悉的名字——李飛飛、吳佳俊。論文鏈接:https://arxiv.org/html/2608.24101v1熟悉具身智能圈的人都知道,這兩個名字放在一起,分量不輕。

李飛飛是世界模型“空間智能”方向的旗幟人物,而剛剛領完 IJCAI 2026 計算機與思想獎的吳佳俊,則是這一領域最核心的研究者之一。這兩位長期合作的學術戰友,最近在具身智能領域動作頻頻。就在一個月前,他們剛與 ControlNet 作者張呂敏等十餘位學者共同發表了《Masked Visual Actions for Unified World Modeling》,把機器人動作渲染成像素軌跡,餵給視頻世界模型。但對於他們而言,之前的嘗試或許還不夠徹底。世界模型能看懂機器人動作了,但機器人動作那一側的問題還卡著:動作怎麼實時變成軌跡?世界模型預演完,怎麼反過來幫機器人挑動作?

這條往返的路,還沒有打通。這一次,他們直指這個問題的核心:機器人的“動作控制”和世界模型的“預測畫面”,說的根本不是同一種語言。TrAct 的解法,就是在中間配一位“同聲傳譯”。01 世界模型的“巴別塔”:動作和像素,雞同鴨講先解釋一下背景。現在具身智能行業正在形成一種共識:光靠 VLA“條件反射”式地輸出動作不夠,得讓機器人學會“先在腦子裡過一遍”——多個候選動作,交給世界模型預演未來,再挑結果最好的執行。π0.5、GR00T 這些頭部 VLA 模型,在標準基準上已經刷到接近滿分。但在真實世界的泛化中,它們依然頻頻翻車。因此,世界模型的“預演”能力,被普遍認為是具身智能的下一個關鍵拼圖。

但問題是,“預演”這出戲,主演對不上臺詞。機器人控制器輸出的是一串低維的“動作方言”:可能是末端位姿,可能是關節角,可能是夾爪開合,也可能三者組合——十幾或二十個低維數字。世界模型需要輸出的是高維的“像素畫面”:夾爪在畫面中的像素座標、輪廓形狀、與物體的距離;麵條在每一幀中如何彎曲、滑動、與碗壁碰撞。每一幀可能是 224×224×3 ≈ 15 萬像素,16 幀就是 240 萬像素。問題來了:20 個數字怎麼推導出 240 萬個像素?從“末端位姿變化 0.02 米”到“夾爪在畫面中向右移動了 50 個像素”,中間隔著一整條物理因果鏈——關節轉動、末端接觸、物體滑動、相機成像。

把前者直接餵給後者,等於給導演看劇本大綱裡的 20 個關鍵詞,讓他腦補出兩個小時的電影。世界模型就是在硬著頭皮幹這個"腦補"的活兒。論文將這種方案稱為 AWM(Action-conditioned World Model,動作條件世界模型) ——給定動作指令,直接預測未來畫面。不意外的是,這套"硬猜硬譯"的方案,翻車姿勢非常典型:夾爪姿態預測錯了;背景和目標物體在預測畫面裡憑空消失;兩個相機視角對同一物體的位置判斷互相打架。更要命的是,每一種機器人的“動作方言”都不一樣。Franka 說 Franka 語(末端位姿+夾爪開合),UR5 說 UR5 語(另一套關節參數),雙臂機器人又說第三套。

同樣是“把麵條放進碗裡”,每臺機器人“念出來的臺詞”完全不同。也就是說,換一臺機器人,之前學的"動作到畫面"的映射幾乎作廢——跨本體泛化,就成了行業公認的死結。一邊是機器人執行不了的像素,一邊是世界模型看不懂的動作。TrAct 的答案:請一位“同聲傳譯”,把兩邊的話翻譯成彼此都懂的語言。這位“同聲傳譯”,叫做視覺軌跡(visual track)。02TrAct :讓視覺軌跡當“同聲傳譯”視覺軌跡是什麼?一句話:具身無關而任務相關的關鍵點,在圖像座標裡隨時間移動的路徑。TrAct 會跟蹤兩類點:1.夾爪點:機械臂夾爪上的 7 個固定網格頂點,覆蓋夾爪的輪廓和運動範圍——解決“手怎麼動”;2.

場景點:圖像平面上 5×5 均勻網格採樣的 25 個點,分散在整個畫面——解決“環境怎麼動”(物體滑動、相機晃動)。這兩類點的分工很明確: 夾爪點是“主動運動”的源頭,直接反映機器人的動作意圖;網格點是“被動運動”的參照,幫助模型判斷畫面變化是來自夾爪移動、物體滑動,還是鏡頭晃動。兩者結合,世界模型才能準確理解“哪些像素動、為什麼動”。這套語言妙就妙在“通用”:不管 Franka、UR5 還是人手,把物體放進碗裡這個動作,翻譯成軌跡都是同一句話——“夾爪關鍵點沿這條路徑移動,物體從當前位置進入碗的區域”。動作帶著本體特異性,軌跡卻是跨本體的“普通話”。

圍繞這個接口,TrAct 搭了一個“劇組”,三個階段、三個組別分工明確:VLAT(Vision-Language-Action-and-Track model),出方案的導演組。在預訓練 flow-matching VLA π0.5 的基礎上改造動作頭,讓它同時輸出動作塊和對應的軌跡塊。動作塊 a是“方言”——末端位姿、關節角、夾爪開合,這些低維的機器人指令;軌跡塊 τ 是“普通話”——任務相關關鍵點在圖像座標系中的運動路徑。兩者必須嚴格成對: 每一組候選方案裡,動作和軌跡來自同一次策略採樣,不能拆開自由組合。這是貫穿全文的一條紅線——預演條件是軌跡,執行控制是動作,兩者必須對應同一套方案。

如果軌跡描繪出一個美好的未來,配對的執行動作卻實現不了這條軌跡,預演就成了“自我感動”。訓練時,VLAT同時優化兩個流匹配損失:動作損失監督“方言怎麼說”,保證指令可執行;軌跡損失監督“普通話怎麼寫”,保證軌跡準確描述了畫面裡點的運動軌跡。換句話說,導演組既要把戲排出來(動作),又要把分鏡畫清楚(軌跡),兩條線同時推進。TWM(Track-conditioned World Model),預演的拍攝組。分鏡畫好了,誰來把它變成成片畫面?拍攝組上場。

TWM以 Stable Video Diffusion(SVD)為視頻生成骨幹,增加了一個 Temporal ControlNet 分支,專門把軌跡座標渲染成空間控制圖。智能體視角(agent-view)的軌跡走紅色通道,腕部視角(wrist-view)走藍色通道——兩個視角共享時間線,各自保留獨立的“機位”。有了軌跡這個普通話版的“分鏡腳本”,世界模型的工作方式徹底變了:之前(AWM)是“給一串方言,硬猜畫面”:給定末端位姿變化0.02米,模型得自己腦補“這會導致夾爪在畫面中向右移動50個像素、同時把麵條推出去、碗的遮擋關係發生變化……”——整條物理因果鏈全靠硬猜。

現在(TWM)是“給一段普通話,按腳本渲染畫面”:已知關鍵點從A位置移動到B位置、物體從P點滑到Q點,把對應的像素生成出來就行。從“因果推理”變成了“條件渲染”,難度降了一個維度。拍攝組不需要理解“關節轉了30度會怎樣”,只需要按照分鏡把畫面拍出來。VLAC(Vision-Language Reward Model),拍板的審片人。畫面拍出來了,誰來定稿?審片人。VLAC基於 InternVL2 的視覺語言獎勵模型,對每條預演視頻按任務指令打分。但它評的不是“畫質清不清晰”,而是“任務完成了沒有”——麵條進碗了嗎?夾爪夠到目標了嗎?關櫃門關嚴了嗎?審片人只看劇情對不對得上劇本。

哪怕樣片畫質有點糊,只要動作做對了,VLAC就給高分;反之,畫面再逼真、動作跑偏了,照樣不及格。推理時,三個角色是這麼協作的:1.導演組出方案:每個決策點,VLAT用TSR(Temperature-Scaled Resampling,溫度縮放重採樣) 生成K個候選動作-軌跡對(仿真K=20,真機K=16)。2.拍攝組拍畫面:TWM拿著每個候選方案裡的軌跡,逐一生成預演視頻。3.審片人打分:VLAC對每條預演視頻按任務指令打分,選出得分最高的那一條。4.執行:把那條高分樣片對應的動作交給機器人執行。選中的永遠是同一對(a,τ)——預演條件與執行控制來自同一次策略採樣。

“想得到”(軌跡預演)和“做得到”(動作執行)被綁定,減少中間的信息傳遞失真。03數據引擎:沒有動作標籤的人類視頻,也能“重用”這套接口的另一重紅利,來自於數據側。機器人數據貴得離譜,而互聯網上人類第一視角操作視頻近乎無限——但人類視頻沒有機器人動作標註,傳統 VLA 拿它們沒什麼辦法。軌跡接口繞開了這堵牆:人類視頻雖然給不了“機器人這段方言怎麼說”,但完全能給得出“這段畫面的分鏡腳本長什麼樣”。於是 TrAct 的預訓練配方是:76K 條 DROID 機器人遙操作數據 + 約 150K 條 EgoDex 人類第一視角操作視頻(約佔完整 EgoDex 的一半),按 1:2 混合。

DROID 的夾爪 7 點、EgoDex 每隻手 7 點加 25 個背景網格點,全部統一映射進同一套軌跡槽位佈局——缺失的相機、操控器和軌跡槽位全部用掩碼處理。這意味著什麼?人類視頻終於不用“翻譯成動作”,就能直接參與機器人模型的預訓練。背後的邏輯很清楚:視覺運動是可以跨具身共享的監督信號,而且這個信號的供給幾乎是無限的。人類視頻的量級,是機器人遙操作數據永遠追不上的。這就讓 TrAct 在預訓練階段獲得了遠超純機器人數據的運動先驗。數據規模和跨具身通用性,兩者在這個接口下被同時激活了。04更嚴酷的考場,更硬核的物理測試▎仿真基準:LIBERO-INTEGRAL 上全面領先先說基準。

標準 LIBERO 上,各家模型的表現已經接近天花板——π0.5 平均 96.8%,TrAct 98.3%,差距不到 2 個點,說明刷榜刷不出區分度。於是團隊自建了一個更嚴酷的考場——LIBERO-INTEGRAL,共 20 個任務:10 個魯棒性任務:涵蓋物體互換(Swap)、物體變化(Object)、任務變化(Task)、相機視角變化(Camera)、機器人初始位姿變化(RobotInit),各 2 個,全部取 LIBERO-Plus 最難檔位;10 個跨具身任務:把場景裡的 Franka Panda 直接換成 UR5,任務規範和場景配置保持不變。“考生”包括四種策略變體:π0.

5:基線 VLA 策略VLAT:聯合預測視覺軌跡和可執行動作,無動作選擇TrAct:完整框架,包含軌跡條件世界模型動作選擇VLAT+AWM:用動作條件替代軌跡條件換到 LIBERO-INTEGRAL這個考場,差距瞬間拉開:• π0.5 平均成功率 27%,其中任務變化 15%、跨本體 17%——“換任務”、“換機器人”恰好是其表現最慘的兩項,而這正是機器人動作執行的痛點所在;• VLAT(加軌跡頭但不做預演)平均成功率是 44%;• VLAT+AWM(用動作條件世界模型做預演)平均成功率是 49%;• TrAct 拿下 55%的成功率,比 π0.

5 翻了一倍還多,比同樣做預演的動作條件版本再高 6 個點。逐類別看,TrAct 在 Swap 65%、Object 60%、Task 50%、Camera 60%、RobotInit 65%、跨本體 50%,六項全部領先;20 個任務裡 18 個拿到最佳或並列最佳。跨本體任務的細節更能說明問題:UR5 版“把橙汁放進籃子”,π0.5 成功率 0.0,TrAct 拉到50%;“把碗放到盤子上”,π0.5 成功率 40%,TrAct 拉到 80%。當然也有翻車的——“拿番茄醬進籃子”,π0.5 是 0.0,TrAct 也只有 10%。團隊沒有迴避這一點:難任務依然難。

統計顯著性也做了確認:三種隨機種子的評估中,TrAct 平均 0.547(95% 置信區間 [0.53, 0.56]),VLAT+AWM 平均 0.490([0.47, 0.51]),兩個置信區間完全不重疊——改進是真實的,不是抽籤抽出來的。▎視頻預演質量:有“分鏡”的,碾壓沒“分鏡”的再看世界模型的視頻預演質量本身。

論文比較了 TWM(軌跡條件,有分鏡) 與 AWM(動作條件,沒分鏡)在仿真和真實兩個場景、智能體和腕部兩個視角下,在五個標準視頻質量指標上的表現:PSNR:峰值信噪比,越高越好;SSIM:結構相似性指數,越高越好;LPIPS:學習感知圖像塊相似度,越低越好;FID:弗雷歇起始距離,越低越好;FVD:弗雷歇視頻距離,越低越好;結果,軌跡條件(TWM)對動作條件(AWM)是全指標碾壓。差距最懸殊的是仿真 + 智能體視角這一配置:TWM 比 AWM, PSNR 高出 62%,SSIM 高出 75%,LPIPS 低了 76%, FID 低37%,FVD 低 70%。

真實世界腕部視角同樣懸殊:TWM 比 AWM,PSNR高出 22% ;SSIM 高出 19% ;LPIPS 低 40% ;FID 從 176 降至 130,低 26% ;FVD 低 43% 。兩個場景、兩個視角、五個指標,TWM 無一例外全部領先。也就是說,有“分鏡”的比沒“分鏡”的預演畫面,質量高出一個維度。把“動作方言”翻譯成“軌跡普通話”再預演,比從動作指令硬猜畫面,準得多。▎更硬核的物理機器人實驗:繼續遙遙領先仿真裡的成功還不夠。團隊把 TrAct 搬到了真實的 Franka Panda 機器人上,看看它在物理世界裡到底扛不扛得住。

機器人配備了兩個 RGB 相機——一個從第三方視角看著整個桌面,一個裝在夾爪上近距離盯著操作區域。訓練數據只有 400 條 15Hz 的演示,覆蓋了 4 個基礎任務;測試則是 5 個訓練時從沒見過的任務:1.將半長粉色麵條放入碗中;2.將熱狗麵包放入碗中;3.將綠色磚塊放入碗中;4.關閉部分打開的右櫃門;5.將傾斜勺中的意大利麵倒入鍋中。每個任務 10 個 episode,而且不僅要過常規背景這一關,還要在換了桌面背景的陌生環境下再跑一遍——看看它會不會被“換了個桌布”就搞懵。最終平均成功率:π0.

5 是 49%,加上 VLAC 評委直接打分是 65%,VLAT+AWM 是 66%,TrAct 是 76%。兩個任務的細節值得單獨拎出來說。一個是“關右邊的櫃門”——五個任務裡唯一接觸密集型的,最能拷打預演精度。常規背景下,π0.5 只有 50%,VLAT+AWM 也才 60%,TrAct 做到 80%;換到陌生背景下,動作條件版本直接掉到40%,TrAct 反而穩在 70%。這就說明,域偏移越大,軌跡接口的優勢越明顯。因為軌跡描述的是"畫面裡該怎麼動",天然不依賴具體背景長什麼樣。另一個是“半根粉色麵條放進碗裡”,TrAct 在常規背景下拿到了滿分。

機器臂夾著一段訓練時沒見過的、更短的麵條,穩穩放進碗裡。泛化能力,同樣肉眼可見。更大規模的預訓練變體 TrAct+(76K DROID + 60K BridgeData V2 + 完整 30 萬級 EgoDex,8 塊 H100 跑 60K 步),也把五個最難的 UR5 任務從 π0.5 的 6%、TrAct 的 32% 進一步拉昇到 38%。這也進一步論證了,接口紅利之外,數據規模紅利依然在兌現。05TrAct 對具身智能行業的意義回過頭來看,TrAct 真正的貢獻,並不在於它刷新了 SOTA,而是“接口層”的統一:以前,動作是世界模型的輸入。

你給 Franka 語它就學 Franka,給 UR5 語它就學 UR5——換臺機器人,推倒重來。現在,機器人動作和世界模型預測之間有了統一的翻譯層。機器人輸出動作(方言),軌跡把它翻譯成“畫面裡的點怎麼動”(普通話),世界模型拿著翻譯結果做預測。機器人動作和世界模型“雞同鴨講”的行業困局,第一次得到系統性的破局。但硬幣的另一面同樣清晰,論文自己也交代得明白:第一,TrAct 不是物理模擬器。軌跡是二維圖像空間的點運動,不顯式建模力、碰撞和接觸狀態;它預測的是"看起來會發生什麼",不保證“物理上一定發生什麼”。第二,預演的可靠性最終依賴 VLAT 的軌跡預測質量。

如果動作本身不可靠,軌跡和動作可能一起錯,高分預演不等於安全執行。第三,它不便宜,每個決策點要跑十幾次視頻生成和打分,推理成本是真金白銀。第四,真機數據也還是少了點:400 條演示,5 個評測任務,離工業級場景的驗證還有距離。在整個行業都在苦尋大模型如何驅動機器人的當下,大家都在問同一個根本問題:世界模型和機器人之間,到底該用什麼語言對話。TrAct 交出了一份極具啟發性的答卷。它證明了,肉眼可見的視覺軌跡,可以成為這一通用的語言。IJCAI 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?

會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

DeepSeek、智譜、阿里、騰訊,誰是大模型真正的斬殺線?

DeepSeek、智譜、阿里、騰訊,誰是大模型真正的斬殺線?Tech星球·2026年09月01日 20:32Agent燒不動Token,大廠集體押注Flash模型。 最近,大模型廠商集體看向了“Flash”。 變化可以從7月份的一個發佈日開始追溯,7月21日,Google DeepMind一口氣端出三款Flash模型,但旗艦Gemini 3.5 Pro缺席。 彼時,Gemini 3.6 Flash的表現被吐槽不如中國一線開源模型,但國內大模型廠商們卻一同捕捉到Flash背後的產業信號,紛紛跟進佈局這一效率架構路線。 十天後,國內大模型市場,DeepSeekV4 Flash正式版上線並開源,284B總參數、每次推理只激活13B。DeepSeek還調整了賣模型的方式,漲價的同時,改成了峰谷分時的計費方式。 8月26日到28日這三天,Flash成了主戰場。三天至少五款重量級模型落地,但Flash版本佔到了多數。 智譜把匿名刷屏“牛來”(Ox-Alpha)認領為 GLM-5.3-Flash,320B總參數,每次只激活 18B;阿里在同一天連夜放出 Qwen3.8-Flash,總參數 125B,每個token只喚醒6B參與計

剛剛
鈦媒體模型更新

升級後的DeepSeek,為何總愛深思熟慮?

DeepSeek升級後回答問題前會花更多時間思考,這不是系統延遲,而是模型主動強化推理、模擬多種解題路徑並檢查邏輯的結果,使數學與程式等複雜問題的正確率明顯提升。然而,簡單的日常問答也可能因等待過久而讓使用者不耐,如何在回應速度與推理品質之間取得平衡,成為這次升級的核心取捨。

剛剛
IT之家模型更新

我國專家牽頭制定,全球首個腿式機器人國際標準正式發佈

作者:清源 責編:清源 評論: 感謝網友 Colorful M 的線索投遞!9 月 1 日消息,據央視新聞援引國家標準委,由我國專家牽頭制定的全球首個腿式機器人國際標準《機器人 —— 服務機器人性能規範及其試驗方法第 5 部分:腿式機器人運動》近日正式發佈。

剛剛
IT之家模型更新

Meta AI 編程工具 Muse Code 結束測試,新增多項功能並開啟訂閱服務

作者:遠洋 責編:遠洋 評論: 9 月 1 日消息,Meta 今日宣佈,旗下 AI 編程工具 Muse Code 已正式結束 Beta 測試,並推出多項新功能,包括會話間消息傳遞、工作流以及命令行界面的“回退”功能。同時,Meta 還發布了 SDK 開發者預覽版,並開始推出訂閱套餐,希望讓用戶能夠更方便地上手使用。

剛剛

史上“最大龍蝦”發佈:OpenClaw 2.0要解決Agent的三大難題

還是那個經常會掛的“手搓感”龍蝦嗎? 沉寂了近兩個月之後,8月31日,OpenClaw正式發佈v2026.8.1,團隊直接把它稱為“OpenClaw 2.0”。 按照官方披露的數據,這是OpenClaw誕生以來規模最大的一次更新:共有933名貢獻者參與,其中569人是第一次為OpenClaw貢獻代碼,累計涉及超過1.6萬個Pull Request。OpenClaw團隊成員Hannes Rudolph稱,單這一個版本包含的PR,就接近項目歷史全部合併PR的50%。 在2.

1 小時前