雷峰網生成式AI

佐治亞理工學院徐丹飛:別被「視覺生成」騙了,視頻預測≠機器人規劃|RSS 2026

2026年7月27日 02:29

重點摘要

解構組合式世界模型,用因子圖與時間注意力跨越“視行斷層” 作者丨張 璐 編輯丨齊鋮湧 當前的具身智能與世界模型領域,正面臨著一個尷尬的現狀。隨著以 Sora 為代表的高保真視頻生成技術走向成熟,模型已經能夠為機器人構建出極其逼真的未來畫面,讓人感覺AGI似乎觸手可及。但回到真實的物理世界,令人困惑的現象出現了:即便模型能夠預測出完美的未來畫面,機械臂在實際落地執行時依然頻頻失效。

站內 AI 整理稿

好的,這是一篇基於您提供的資料,重新撰寫、結構更完整、更具新聞性的深度報導。 ---

### 新聞特寫:視覺迷思與物理斷層——佐治亞理工徐丹飛在RSS 2026直指機器人規劃的核心困境

**當生成式AI能夠憑空創造出栩栩如生的未來畫面,機器人為何依然在真實世界中步履蹣跚?** 這不僅是一個技術問題,更是當前人工智能發展中一個深刻且矛盾的迷思。在頂尖學術會議RSS 2026的現場,佐治亞理工學院助理教授、NVIDIA研究員徐丹飛(Danfei Xu)發表了一場題為《組合式世界模型》的主旨演講,直接向當前主流的「視覺生成等同於機器人規劃」的觀點投下了一枚震撼彈。徐丹飛指出,隨著以Sora為代表的高保真視頻生成模型席捲全球,學術界與工業界出現了一種危險的樂觀情緒:似乎只要機器人能夠「想像」出一個完美的未來,就能夠順利地在現實中復現它。

然而,殘酷的現實是,當機械臂被部署到具體任務中,即使模型生成的「預演視頻」天衣無縫,實際的抓取、放置、操作動作依然頻頻失敗。他將此現象定義為**「視頻-動作跨越斷層」(Video-Action Gap)**——能夠「生成」成功的結果,絕不等同於擁有真正的「規劃能力」。這番觀點,為當前略顯浮躁的具身智能領域,注入了一劑清醒的良藥。#### 「生成」不等於「規劃」:打破對視覺預測的迷信

徐丹飛在演講中反覆強調一個核心觀點:生成(Generation)與規劃(Planning)是兩個本質不同的概念。生成模型,即使是最高級的擴散模型,其本質是從海量訓練數據中提取一個高概率的、看起來合理的結果。它能「腦補」出冰箱門被打開、物品被放入的畫面,因為訓練數據中充滿了這類場景。但規劃,意味著必須在面對一個從未見過的全新任務組合時,即時地、在測試階段(Test-time)構造出一個滿足所有物理約束的「有效解」。他以一個看似簡單的複合任務——「將重物放入冰箱」為例進行了說明。假設訓練數據中分別有「雙手抱重物」、「打開冰箱門」和「高位擺放」這三種技能。

一個純粹的生成模型,很可能會基於視覺相似性拼湊出一個畫面:機械臂抱著重物的同時,嘗試去拉開冰箱門。這在外觀上似乎「合理」,但在物理世界中卻荒謬至極,因為它違反了最基本的「兩隻手不能同時做兩件事」的時空約束。這暴露了當前技術路線的關鍵瓶頸:**高保真度的視覺流暢性,掩蓋了對物理因果律與行動序列邏輯的深刻無知。** 機器人能夠「看」懂畫面,但卻無法據此「做」出連貫的動作。要從「生成」跨越到「規劃」,徐丹飛認為,必須具備兩個核心要素:一是具有強大泛化能力的先驗知識表達;二是一種能夠在測試階段、以目標為導向進行動態組合的機制。#### 積木式思維:因子圖與技能的可組合性

為了破解長流程任務與複雜物理約束的難題,徐丹飛提出了他的破局思路——「組合式世界模型」。這個概念的核心思想,源自人工智能先驅馬文·明斯基的啟發:將複雜系統解耦為簡單的模塊化組件。 他比喻道,我們應該讓機器人學會一系列「基礎技能」,就像搭積木一樣。關鍵在於,這些技能之間如何進行有效銜接?徐丹飛引入了一個巧妙的邏輯:前一個技能終止時的狀態分佈,必須與後一個技能成功啟動的起始狀態區間完美重疊。這個「狀態交集」,是兩個技能之間能夠順暢傳遞的「契約」。 然而,傳統的線性串聯方式效率極低。當任務鏈條變長時,信息需要在整條鏈路上進行多次震盪。為此,徐丹飛團隊將結構擴展為**「因子圖」(Factor Graphs)**。這個工具允許研究人員在空間和時間維度上同時定義多種約束條件:

* **空間維度**:精確約束機械臂末端與目標物體間的相對位置與姿態。 * **時間維度**:確保物體在移動過程中與機械臂姿態的動態同步。 * **多臂協同**:無需專門訓練大量的雙臂協同數據,只需訓練好單臂技能,然後在測試時通過因子圖動態約束兩個單臂模型進行組合即可。 這種方法展現了強大的潛力。在演示中,機器人能夠通過因子圖的即時調度,完成過去需要特定數據訓練才能實現的複雜任務,例如雙手協同抬起沉重的雙耳鍋並精確旋轉角度,或者左手遞出錘子、右手精準接住並完成敲擊。**這標誌著機器人規劃進入了一個「模塊化時代」,其核心不再是死記硬背技能序列,而是在現場動態拼裝解決方案。**

#### 揭開斷層真相:時間注意力與策略引導

在研究過程中,一個更棘手的工程問題浮出水面:即使世界模型預測出了完美無瑕的未來視頻,機器人的底層控制器卻無法跟隨。徐丹飛將此歸因於**數據的結構性失衡**。視頻大模型吸收了互聯網上海量的視覺數據,泛化能力極強;而機器人的底層動作(Action)數據,因其獲取成本極高、場景單一,嚴重匱乏。這導致了一個有趣的現象:視頻生成模型已經成功泛化到了新場景,但控制模型卻停滯不前。為了量化這個「視頻-動作斷層」,徐丹飛團隊提出了一個全新的診斷指標——**時間注意力比例(Temporal Ratio)**。

這個指標用於衡量機器人的控制模型在決策時,究竟把注意力分配給了「預測的未來畫面」還是「眼前當下的傳感器數據」。通過大量的實驗,他們發現了一個重要的規律:當機器人處於「接近目標」(Reaching)階段時,它需要預測未來軌跡,因此對未來的注意力佔比顯著偏高;而一旦進入物理接觸與抓取的「操控階段」(Grasping),模型會將大部分注意力瞬間拉回到當前幀,轉而依賴實時的觸覺與視覺反饋進行微調。基於這一洞察,徐丹飛提出了**「策略引導」(Policy Guidance)**的解決方案。

在測試階段,可以根據機器人實時的狀態,動態調整其注意力權重:在接近目標時,強化模型對未來的預測;在接觸物體的瞬間,強制拉回注意力,專注於當下的微調。這一方法顯著提升了機器人在面對分佈外(OOD)複雜任務時的真實執行成功率,證明了僅有視覺預測是不夠的,必須要有一個**智能的、可調度注意力的規劃器**來指導行動。#### 反思與前瞻:失敗數據的價值與模型的分立架構

在演講後的問答環節,徐丹飛進一步分享了他對行業爭議的思考。當被問及訓練數據中「失敗樣本」的價值時,他表示,目前業界偏愛成功數據,是因為缺乏一個能高效利用「失敗」的規劃器。他認為,**能夠精準預測「某種動作會導致失敗」的模型,其安全價值遠高於僅僅預測成功。** 未來,有意識地收集並利用失敗軌跡,將是拓展世界模型安全邊界的關鍵。 而針對學術界一個核心爭論——「世界模型是否應與策略模型融合為一體」,徐丹飛給出了明確的立場:應保持兩者分立。他提出了兩點支撐性理由:

1.**欠擬合問題**:目前模型容量遠未飽和,視頻數據與動作數據的規模和分佈迥異。強行融合會讓一個本就難以收斂的世界擬合任務,再額外背負控制任務,大幅增加預訓練的難度。2.**數據利用方式不同**:策略模型需要精準、高質量的成功數據(適合SFT或強化學習微調),而世界模型需要吸納海量、多樣的失敗與邊緣數據來構建完整的世界認知。將兩者解耦,各司其職地進行針對性優化,才是當前更為高效和穩妥的技術路徑。**規劃的本質,遠不止是在腦海中播放一部流暢的未來電影。** 徐丹飛的演講如同一面鏡子,映照出演算法與物理世界之間那道名為「規劃」的鴻溝。

他的組合式世界模型及其對「視頻-動作斷層」的深刻剖析,為機器人領域指明了一個關鍵方向:未來的突破點,不在於生成更逼真的畫像,而在於發展出更強大的**測試階段組合機制**與**精準的物理邏輯推理能力**。只有當機器人的預測與動作在真實世界的物理約束下實現精準對齊時,世界模型的潛能才算真正被釋放。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

34 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前