Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」

2026年7月27日 10:53
Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」

重點摘要

### Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」,長上下文成新突破方向 在機器人領域,上下文窗口的限制一直是制約其長期任務執行的關鍵瓶頸。如同大語言模型(LLM)通過擴展上下文長度實現了顯著的性能飛躍,機器人也迫切需要類似的能力來增強記憶和決策。然而,過去受限於極短的上下文窗口,機器人往往會迅速遺忘剛剛發生的信息,導致在多階段長程任務中表現不佳。

站內 AI 整理稿

### Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」,長上下文成新突破方向

在機器人領域,上下文窗口的限制一直是制約其長期任務執行的關鍵瓶頸。如同大語言模型(LLM)通過擴展上下文長度實現了顯著的性能飛躍,機器人也迫切需要類似的能力來增強記憶和決策。然而,過去受限於極短的上下文窗口,機器人往往會迅速遺忘剛剛發生的信息,導致在多階段長程任務中表現不佳。針對這一挑戰,英偉達高級研究科學家Jim Fan與斯坦福大學教授、“AI教母”李飛飛團隊及其合作者,聯合推出了革命性的機器人模型與訓練方案RoboTTT(Test-Time-Training Robot Policies)。

這項研究將視覺運動上下文擴展到8K時間步,相當於5分鐘的“肌肉記憶”,比現有最優策略高出三個數量級,且不增加推理延遲。相關論文已發佈在arXiv上,引發業界廣泛關注。RoboTTT的核心創新在於將測試時訓練(TTT)嵌入機器人基礎模型,從而實現高效的長上下文建模。具體而言,RoboTTT利用快速權重作為模型的循環狀態,每次接收傳感器輸入時,模型都會執行一步梯度更新,將歷史信息動態寫入權重中。這種設計的優勢在於,隱藏狀態大小固定,使得機器人能夠在較低開銷下保留更長曆史信息,並在部署後繼續學習和適應。從架構上看,RoboTTT由視覺-語言模型(VLM)骨幹和帶有TTT層的DiT動作頭組成。

注意力層專注於處理單個時間步內的信息,而TTT層則沿時間維度捕捉跨時間依賴性。為提高計算效率,模型不直接處理所有視覺-語言token,而是採用少量register token在時間上傳遞關鍵信息。此外,TTT輸出經Tanh Gating後再加入注意力輸出,有效保留了預訓練能力。在訓練方法上,RoboTTT結合了序列動作強制和截斷反向傳播算法(TBPTT),以支持長上下文訓練。序列動作強制為每個動作塊獨立採樣噪聲水平,有助於穩定flow-matching訓練;TBPTT則將長序列劃分為片段,只在片段內反向傳播梯度,但允許快速權重繼續跨片段傳遞信息。

這種方法既實現了TTT在整條序列中的貫穿應用,又將顯存開銷控制在片段長度範圍內。同時,RoboTTT還引入了長上下文約束機制,將部分時間步僅作為上下文使用。這些時間步會更新快速權重,但不參與動作損失計算。基於此,模型可以從兩種上下文中學習:一是人類視頻模仿,其中人類視頻作為上下文更新權重,動作損失在機器人軌跡上計算;二是DAgger蒸餾,完整軌跡更新權重,但損失只在人類糾正動作上計算,從而將失敗後的糾正方式編碼到權重中。研究團隊在三個具有挑戰性的長程雙臂裝配任務上對RoboTTT進行了全面評估,包括Pup Go Car(玩具車裝配)、Circuit(電路裝配)和Gear Bot(齒輪機器人)。

這些任務平均持續約5分鐘,包含多個階段,對機器人的記憶和適應能力提出了極高要求。基線方法包括單步上下文策略GR00T N1.7以及將TTT層替換為Gated DeltaNet的GDN,後者同樣採用循環狀態但更新機制不同。結果顯示,RoboTTT在所有任務上均表現出色,平均任務完成分數達到79%,顯著高於基線方法。特別是在最複雜的Gear Bot任務中,RoboTTT是唯一能夠完整完成全部10個階段的方法。此外,RoboTTT在區分視覺相似階段、從失誤中恢復以及執行細粒度操作方面均展現出優勢,例如在電鑽對準螺絲時能主動重新對齊。進一步的實驗揭示了上下文長度對性能的顯著影響。

當預訓練上下文從128時間步擴展到8K時間步時,RoboTTT的平均任務完成分數從較低水平提升至71.5%,相比1K版本提高了63%,且未出現飽和跡象。相比之下,GDN在上下文變長時並未獲得同等提升,研究團隊認為這歸因於RoboTTT的梯度下降更新機制:它能夠學習快速權重的初始化和更新方式,而GDN的線性關聯狀態不具備這種元學習能力。這一發現表明,上下文長度可作為機器人基礎模型的一個新型scaling軸,具有廣闊的發展潛力。Jim Fan甚至在社交平台發文稱:“很快,即使是100萬上下文,也不再是幻想。”

RoboTTT還展現了獨特的一次性模仿和擾動恢復能力。基於上下文中的單段人類視頻,機器人能夠在未見配置下完成任務。在Circuit任務中,RoboTTT在10次試驗中成功6次,任務完成分數為65%,而GDN從未完全成功。在物理擾動測試中,當人類故意移除已安裝部件時,RoboTTT能夠根據上下文自主返回並重新安裝。例如,車頂被移除時,RoboTTT的恢復率為75%,高於GDN的65%和短上下文基線的50%;輪胎被移除時,恢復率達到90%,與GDN持平但高於基線。這種魯棒性源自長上下文對歷史信息的高效利用。此外,RoboTTT的DAgger蒸餾機制賦予了其強大的即時恢復能力。

與標準DAgger僅在人類糾正動作上微調不同,RoboTTT將完整軌跡(包括次優機器人動作)作為上下文,但只在糾正動作上計算損失。結果顯示,標準DAgger平均提升9%,而RoboTTT的DAgger蒸餾平均提升33%。這意味著RoboTTT學習了一種隱式糾錯算法,能夠在執行過程中從自身錯誤中恢復,無需人工干預。這種自我改進能力特別適合需要連續調整的長程任務。儘管成果顯著,研究團隊也指出了RoboTTT現有的不足。首先,擴展訓練上下文長度會增加訓練成本,雖然推理成本保持恆定,但訓練效率仍有待提升。未來可採用更高效的TTT訓練技術(如TNT)來降低成本。

其次,TTT層的目標函數存在探索空間,面向機器人的專用目標可能進一步改善性能。此外,RoboTTT未覆蓋部署中可能出現的全部失敗模式,與強化學習結合以直接優化任務成功率,被認為是極具潛力的未來方向。團隊強調,RoboTTT只是一個開端,長上下文的潛力遠不止於此。綜合來看,RoboTTT為機器人領域開闢了新的可能性。通過將上下文長度作為新的scaling方向,研究團隊不僅解決了長期困擾機器人領域的記憶瓶頸,還展示了從人類視頻中進行一次性模仿、實時自我改進以及對物理擾動的強大魯棒性。隨著技術的持續迭代,RoboTTT有望成為未來機器人基礎模型的關鍵組件,推動具身智能從實驗室走向更廣泛的實際應用。

正如Jim Fan所言,機器人的上下文擴展才剛剛開始,未來百萬級上下文或將徹底改變智能體的行為模式。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

11 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前