李飛飛高徒黃文龍:具身智能需要一次「腦內搜索」革命 | RSS 2026

2026年8月19日 06:11
站內 AI 整理稿

斯坦福團隊提出:機器人不需要見過所有的失敗,它只需要學會如何“腦補”另一種可能。作者丨岑峰 在 AGI 的數字版圖裡,大語言模型僅靠“讀遍互聯網文本”就拼湊出了通往智能的通途。這種由 Scaling Law 帶來的暴力美學,讓整個具身智能行業在過去兩年裡陷入了一種盲目的“數據崇拜”:人們堅信,只要像訓練大模型一樣,喂下數以百萬小時的視頻,機械臂就能在物理世界中無所不能。而在2026 年的悉尼 RSS 大會,AI科技評論注意到,越來越多的研究者開始討論,物理世界的數據獲取具有時間和空間的“不可逆性”——文本可以被瞬間複製億萬次,但機械臂抓取一次杯子,在物理時空中就必須實打實地消耗數秒。

更致命的是長尾效應:摩擦、形變、流體……人類根本不可能通過窮舉法,去收集齊機器人面臨的所有場景。來自斯坦福大學李飛飛實驗室的 黃文龍(Wenlong Huang),在“Data-Centric Robotics”主題Workshop的演講中給出了一個“降維打擊”式的解法:拋棄對海量“演示數據”的死記硬背,轉向“反事實推理”與“腦內搜索”。作為近年具身智能領域的明星學者,黃文龍的名字此前因 VoxPoser 和 ReKep 兩篇里程碑式的論文而廣為人知。

在這兩項研究中,他利用大模型作為空間規劃器,將人類的抽象指令轉化為三維空間中的“關鍵點約束”和“價值場”,首次讓機器人無需任何行為演示,就能直接根據幾何常識完成複雜的操作。而在此次 RSS 2026 的分享中,黃文龍更進一步,首次將這一哲學推向了“3D世界模型”的終極形態——Point-World。這場演講的重大現實意義在於,它用嚴密的邏輯和前沿實驗,揭示了具身智能下半場的進化範式: Point-World 的誕生,意味著機器人終於擁有了一個可以“零樣本預測未來物理演變”的數字孿生大腦。

機器人可以在真正動手前,在腦海中虛擬嘗試成千上萬種“如果我這麼做,會發生什麼”的反事實可能性,從而在沒有人類演示過的情況下,自主創造出諸如“把襪子由內而外翻過來”的獨創性行為。同時,黃文龍還展示了僅需 15 小時的 3D 交互數據配合 2D 預訓練,就能撬動世界模型的驚人擴展能力。這為具身智能走向“遞歸自我改進(Recursive Self-improvement)”——即機器人一生的持續自主學習——推開了最後的大門。英偉達 Cosmos 3 正在試圖用全模態定義具身生態的“安卓系統”,而黃文龍與斯坦福團隊則在底層邏輯上,為全球開發者提供了一套突破算力和數據封鎖的“終極進化算法”。

以下是黃文龍的演講分享,AI科技評論根據其英文演講內容進行了不改原意的編輯:01通過反事實推斷實現機器人數據的跨越式擴展演講者: 斯坦福大學 黃文龍(導師:李飛飛)▎一、 動機:從“演示學習”到“自主探索”大家好非常榮幸與各位討論機器人數據擴展的新視角。本次 Workshop 的主題是“以數據為中心的機器人學(Data-Centric Robotics)”,而我今天想分享的核心主題是:我們或許可以通過“反事實推斷(Counterfactuals)”來有效擴展機器人的能力邊界。過去幾年,我們在實現“開放世界機器人”的征程中取得了顯著進展。

從算法層面看,我們擁有了表現力更強的架構,如擴散策略(Diffusion Policies)、基於 VLM 的架構,以及近期湧現的世界模型;從硬件層面看,低成本硬件的普及讓研究門檻大幅降低。目前行業已達成一個共識:只要我們能演示出來的行為,策略就能學會。但我這裡有一段非常有啟發性的視頻:這是一個由 Physical Intelligence 展示的任務——將一隻襪子由內而外翻轉。這並不是由複雜的多指靈巧手完成的,而只是一個普通的平行夾爪。機器人將一隻夾爪伸進襪子內部,配合另一個夾爪完成捏拉動作。這個任務非常酷,但也揭示了一個深刻的問題:這種動作很難用語言或代碼來精確描述,必須看視頻才能理解。

更重要的是,作為人類,我可能從未在訓練數據中見過這種“翻襪子”的技巧,但我擁有“獨創性(Ingenuity)”,能在面對新問題時即興創造解法。這種自主獲取新行為的能力,是目前機器人所缺失的。如果機器人僅依賴互聯網規模的數據或自身的歷史數據,它可能永遠無法跨越某些能力的鴻溝。▎二、 反事實推斷與搜索的價值要複製人類的這種獨創性,關鍵在於反事實思維。所謂反事實,是指在擁有一條標準任務軌跡的前提下,模型有能力去評估:“如果我採取了一組完全不同的動作,結果會怎樣?”回顧人工智能史上的重大突破,這種能力始終是核心驅動力。

以 AlphaGo 為例,著名的“第 37 手”是人類圍棋史上從未出現過的走法,但 AI 通過搜索和推演,判斷出這是當下的最優解。在當年的 AlphaGo 論文中有一組令人震驚的數據:如果移除測試時的搜索過程,模型需要增加 10 萬倍的數據量才能維持同等的性能。如果說機器人學比圍棋和編程更難,那麼我們就有理由相信,這種“反事實推理”和“搜索”的能力是不可或缺的。▎三、 為什麼是 3D 幾何空間?如果我們需要這種能力,那麼應該在什麼維度上進行反事實推理?1.語言與代碼空間: 這在 2021 年我們曾嘗試過。通過大語言模型分解任務步驟。

雖然邏輯上可行,但在涉及底層物理交互(如翻襪子)時,語言模型完全無法描述物理細節。2.動作空間: 機器人形態各異,夾爪長度、指尖材質、甚至機械臂數量都不同,很難建立一個統一且通用的低級動作空間來思考“萬一”。我認為,推理的最佳空間是基於機器人幾何結構的 3D 空間。這就是我們最近的工作:Point World。其核心理念是:給定 RGB-D 輸入和機器人的描述文件(URDF),我們將機器人的動作空間統一定義為 “3D 點雲流(3D Point Flows)”。通過從機器人的每個連桿上採樣點,計算正運動學,我們將場景觀測和機器人動作全部統一在 3D 點雲流中。

我們訓練了一個基於 Transformer 的模型,它本質上是一個“零樣本(Zero-shot)真實世界模擬器”。模型不僅能模擬剛體,還能處理流體、布料等可變形物體,且無需物體分割。它能隱式地識別冰箱的運動關節結構,並在物體被遮擋(如第一人稱視角看盒子背面)時,根據物理常識推斷接觸幾何關係。▎四、 彌補 3D 數據的匱乏大家通常認為 3D 數據是稀缺的。為此,我們利用先進的視覺幾何模型,對大規模交互數據(Joy 數據集)進行了重標註,生成了具有仿真級精度深度信息和相機位姿的 3D 點雲,總計約 3500 小時。有了這些數據,我們可以通過增加模型參數、優化訓練目標,大幅提升世界模型的保真度。

更令人興奮的是後續的一項未發表工作:我們發現,利用 2D 視頻數據進行預訓練,再輔以僅 15 小時 的 3D 交互數據進行微調,就能獲得比之前 500 小時訓練更好的環境動力學預測能力。這個模型在完全沒見過的環境、沒見過的機械臂上,依然能保持極高的物理保真度。▎五、 總結與展望在這個算力和數據擴展的時代,我們的關注點通常集中在“獲取更多數據以實現更好的零樣本泛化”。但我認為這並非全貌。真正的學習應該伴隨機器人的一生。機器人必須具備一種自主獲取新行為的能力,並將這些新行為編譯進現有的模型中。總結通往人類水平物理交互的路徑:1.前提條件: 獲得關於行為和動力學的通用先驗(世界模型)。2.

關鍵步驟: 將這些先驗在物理世界中落地,並通過反事實推斷和搜索,不斷探索、獲取新的行為。這或許就是具身智能領域一直在追求的“遞歸自我改進(Recursive Self-improvement)”。謝謝大家。一個人讀論文太孤單,一群人刷頂會才好玩。RSS 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。?進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備註:論文群 + 關注的 AI 方向。搞科研/搞技術,信息差很重要。來,一起快人一步!

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛