Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」

重點摘要
### Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」,長上下文成新突破方向 在機器人領域,上下文窗口的限制一直是制約其長期任務執行的關鍵瓶頸。如同大語言模型(LLM)通過擴展上下文長度實現了顯著的性能飛躍,機器人也迫切需要類似的能力來增強記憶和決策。然而,過去受限於極短的上下文窗口,機器人往往會迅速遺忘剛剛發生的信息,導致在多階段長程任務中表現不佳。
### Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」,長上下文成新突破方向
在機器人領域,上下文窗口的限制一直是制約其長期任務執行的關鍵瓶頸。如同大語言模型(LLM)通過擴展上下文長度實現了顯著的性能飛躍,機器人也迫切需要類似的能力來增強記憶和決策。然而,過去受限於極短的上下文窗口,機器人往往會迅速遺忘剛剛發生的信息,導致在多階段長程任務中表現不佳。針對這一挑戰,英偉達高級研究科學家Jim Fan與斯坦福大學教授、“AI教母”李飛飛團隊及其合作者,聯合推出了革命性的機器人模型與訓練方案RoboTTT(Test-Time-Training Robot Policies)。這項研究將視覺運動上下文擴展到8K時間步,相當於5分鐘的“肌肉記憶”,比現有最優策略高出三個數量級,且不增加推理延遲。相關論文已發佈在arXiv上,引發業界廣泛關注。 RoboTTT的核心創新在於將測試時訓練(TTT)嵌入機器人基礎模型,從而實現高效的長上下文建模。具體而言,RoboTTT利用快速權重作為模型的循環狀態,每次接收傳感器輸入時,模型都會執行一步梯度更新,將歷史信息動態寫入權重中。這種設計的優勢在於,隱藏狀態大小固定,使得機器人能夠在較低開銷下保留更長曆史信息,並在部署後繼續學習和適應。從架構上看,RoboTTT由視覺-語言模型(VLM)骨幹和帶有TTT層的DiT動作頭組成。注意力層專注於處理單個時間步內的信息,而TTT層則沿時間維度捕捉跨時間依賴性。為提高計算效率,模型不直接處理所有視覺-語言token,而是採用少量register token在時間上傳遞關鍵信息。此外,TTT輸出經Tanh Gating後再加入注意力輸出,有效保留了預訓練能力。 在訓練方法上,RoboTTT結合了序列動作強制和截斷反向傳播算法(TBPTT),以支持長上下文訓練。序列動作強制為每個動作塊獨立採樣噪聲水平,有助於穩定flow-matching訓練;TBPTT則將長序列劃分為片段,只在片段內反向傳播梯度,但允許快速權重繼續跨片段傳遞信息。這種方法既實現了TTT在整條序列中的貫穿應用,又將顯存開銷控制在片段長度範圍內。同時,RoboTTT還引入了長上下文約束機制,將部分時間步僅作為上下文使用。這些時間步會更新快速權重,但不參與動作損失計算。基於此,模型可以從兩種上下文中學習:一是人類視頻模仿,其中人類視頻作為上下文更新權重,動作損失在機器人軌跡上計算;二是DAgger蒸餾,完整軌跡更新權重,但損失只在人類糾正動作上計算,從而將失敗後的糾正方式編碼到權重中。 研究團隊在三個具有挑戰性的長程雙臂裝配任務上對RoboTTT進行了全面評估,包括Pup Go Car(玩具車裝配)、Circuit(電路裝配)和Gear Bot(齒輪機器人)。這些任務平均持續約5分鐘,包含多個階段,對機器人的記憶和適應能力提出了極高要求。基線方法包括單步上下文策略GR00T N1.7以及將TTT層替換為Gated DeltaNet的GDN,後者同樣採用循環狀態但更新機制不同。結果顯示,RoboTTT在所有任務上均表現出色,平均任務完成分數達到79%,顯著高於基線方法。特別是在最複雜的Gear Bot任務中,RoboTTT是唯一能夠完整完成全部10個階段的方法。此外,RoboTTT在區分視覺相似階段、從失誤中恢復以及執行細粒度操作方面均展現出優勢,例如在電鑽對準螺絲時能主動重新對齊。 進一步的實驗揭示了上下文長度對性能的顯著影響。當預訓練上下文從128時間步擴展到8K時間步時,RoboTTT的平均任務完成分數從較低水平提升至71.5%,相比1K版本提高了63%,且未出現飽和跡象。相比之下,GDN在上下文變長時並未獲得同等提升,研究團隊認為這歸因於RoboTTT的梯度下降更新機制:它能夠學習快速權重的初始化和更新方式,而GDN的線性關聯狀態不具備這種元學習能力。這一發現表明,上下文長度可作為機器人基礎模型的一個新型scaling軸,具有廣闊的發展潛力。Jim Fan甚至在社交平台發文稱:“很快,即使是100萬上下文,也不再是幻想。”
RoboTTT還展現了獨特的一次性模仿和擾動恢復能力。基於上下文中的單段人類視頻,機器人能夠在未見配置下完成任務。在Circuit任務中,RoboTTT在10次試驗中成功6次,任務完成分數為65%,而GDN從未完全成功。在物理擾動測試中,當人類故意移除已安裝部件時,RoboTTT能夠根據上下文自主返回並重新安裝。例如,車頂被移除時,RoboTTT的恢復率為75%,高於GDN的65%和短上下文基線的50%;輪胎被移除時,恢復率達到90%,與GDN持平但高於基線。這種魯棒性源自長上下文對歷史信息的高效利用。 此外,RoboTTT的DAgger蒸餾機制賦予了其強大的即時恢復能力。與標準DAgger僅在人類糾正動作上微調不同,RoboTTT將完整軌跡(包括次優機器人動作)作為上下文,但只在糾正動作上計算損失。結果顯示,標準DAgger平均提升9%,而RoboTTT的DAgger蒸餾平均提升33%。這意味著RoboTTT學習了一種隱式糾錯算法,能夠在執行過程中從自身錯誤中恢復,無需人工干預。這種自我改進能力特別適合需要連續調整的長程任務。 儘管成果顯著,研究團隊也指出了RoboTTT現有的不足。首先,擴展訓練上下文長度會增加訓練成本,雖然推理成本保持恆定,但訓練效率仍有待提升。未來可採用更高效的TTT訓練技術(如TNT)來降低成本。其次,TTT層的目標函數存在探索空間,面向機器人的專用目標可能進一步改善性能。此外,RoboTTT未覆蓋部署中可能出現的全部失敗模式,與強化學習結合以直接優化任務成功率,被認為是極具潛力的未來方向。團隊強調,RoboTTT只是一個開端,長上下文的潛力遠不止於此。 綜合來看,RoboTTT為機器人領域開闢了新的可能性。通過將上下文長度作為新的scaling方向,研究團隊不僅解決了長期困擾機器人領域的記憶瓶頸,還展示了從人類視頻中進行一次性模仿、實時自我改進以及對物理擾動的強大魯棒性。隨著技術的持續迭代,RoboTTT有望成為未來機器人基礎模型的關鍵組件,推動具身智能從實驗室走向更廣泛的實際應用。正如Jim Fan所言,機器人的上下文擴展才剛剛開始,未來百萬級上下文或將徹底改變智能體的行為模式。
Related
相關文章

OpenAI 和 Anthropic,正在砸錢搶這個市場
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

奧特曼馬斯克豪言:我們已進入奇點,AGI加速窗口已至
這篇消息聚焦「奧特曼馬斯克豪言:我們已進入奇點,AGI加速窗口已至」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

AI 大模型周榜:Kimi K3 蟬聯前端開發榜全球第一、智能體榜表現突出
首頁 > 智能時代>人工智能 AI 大模型周榜:Kimi K3 蟬聯前端開發榜全球第一、智能體榜表現突出 2026/7/27 16:35:22 來源:IT之家 作者:小泵 責編:小泵 評論: IT之家 7 月 27 日消息,Arena(arena.ai)平臺今日發佈了 2026 年第 30 周的 AI 大模型排行數據,統計週期為 2026-07-20 ~ 2026-07-26。

三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報新智元·2026年07月27日 16:01八月的模型戰場,硝煙已經點燃 GPT-6和Fable 5.1,已經準備就位,很可能8月上線。 據悉,本週奧特曼已經突降華盛頓,展示了OpenAI有史以來的最強大模型——GPT-6。 據外媒Axios爆料,GPT-6 已經具備了進行原創科學研究的能力,並在內部測試中通過不休不眠的智能體集群(Agent Swarms),展現出危險的長程規劃與自主滲透能力。 而就在同一時刻,Anthropic這邊也有消息洩露:Fable 5.1 已經就位,瞄準 8 月,加量不加價,試圖以田忌賽馬戰術,在GPT-6落地前完成狙擊。 這個8月,註定不平靜,一場肉搏戰即將打響,目標直指ASI的奇點時刻。 Anthropic的暗中狙擊:Fable 5.1已準備好,等待一擊斃命 Anthropic 顯然已經嗅到奇點逼近的氣息。 業內爆料證實,Anthropic 籌備已久的 Fable 5.1 已經完成內部測試,瞄準 8 月發佈。 並且,它的定價將維持與Fable 5完全相同(輸入 $10 / 輸出 $50 每百萬 Token)。

Claude Code狂刪80%提示詞,Opus 5反手加回去了
Anthropic 在 Claude Code 中刪除了 80% 的提示詞,但隨著更強大的 Opus 5 模型推出,這些提示詞不僅被全數恢復,還新增了更多規範,導致「模型越強、規矩越多」的現象。業界分析認為,這反映出 Anthropic 在提升模型能力與維持使用行為可控性之間的反覆權衡,後續提示工程反而走向更嚴謹複雜的路徑。