佐治亞理工學院徐丹飛:別被「視覺生成」騙了,視頻預測≠機器人規劃|RSS 2026
重點摘要
解構組合式世界模型,用因子圖與時間注意力跨越“視行斷層” 作者丨張 璐 編輯丨齊鋮湧 當前的具身智能與世界模型領域,正面臨著一個尷尬的現狀。隨著以 Sora 為代表的高保真視頻生成技術走向成熟,模型已經能夠為機器人構建出極其逼真的未來畫面,讓人感覺AGI似乎觸手可及。但回到真實的物理世界,令人困惑的現象出現了:即便模型能夠預測出完美的未來畫面,機械臂在實際落地執行時依然頻頻失效。
好的,這是一篇基於您提供的資料,重新撰寫、結構更完整、更具新聞性的深度報導。 ---
### 新聞特寫:視覺迷思與物理斷層——佐治亞理工徐丹飛在RSS 2026直指機器人規劃的核心困境
**當生成式AI能夠憑空創造出栩栩如生的未來畫面,機器人為何依然在真實世界中步履蹣跚?** 這不僅是一個技術問題,更是當前人工智能發展中一個深刻且矛盾的迷思。在頂尖學術會議RSS 2026的現場,佐治亞理工學院助理教授、NVIDIA研究員徐丹飛(Danfei Xu)發表了一場題為《組合式世界模型》的主旨演講,直接向當前主流的「視覺生成等同於機器人規劃」的觀點投下了一枚震撼彈。 徐丹飛指出,隨著以Sora為代表的高保真視頻生成模型席捲全球,學術界與工業界出現了一種危險的樂觀情緒:似乎只要機器人能夠「想像」出一個完美的未來,就能夠順利地在現實中復現它。然而,殘酷的現實是,當機械臂被部署到具體任務中,即使模型生成的「預演視頻」天衣無縫,實際的抓取、放置、操作動作依然頻頻失敗。他將此現象定義為**「視頻-動作跨越斷層」(Video-Action Gap)**——能夠「生成」成功的結果,絕不等同於擁有真正的「規劃能力」。這番觀點,為當前略顯浮躁的具身智能領域,注入了一劑清醒的良藥。 #### 「生成」不等於「規劃」:打破對視覺預測的迷信
徐丹飛在演講中反覆強調一個核心觀點:生成(Generation)與規劃(Planning)是兩個本質不同的概念。生成模型,即使是最高級的擴散模型,其本質是從海量訓練數據中提取一個高概率的、看起來合理的結果。它能「腦補」出冰箱門被打開、物品被放入的畫面,因為訓練數據中充滿了這類場景。但規劃,意味著必須在面對一個從未見過的全新任務組合時,即時地、在測試階段(Test-time)構造出一個滿足所有物理約束的「有效解」。 他以一個看似簡單的複合任務——「將重物放入冰箱」為例進行了說明。假設訓練數據中分別有「雙手抱重物」、「打開冰箱門」和「高位擺放」這三種技能。一個純粹的生成模型,很可能會基於視覺相似性拼湊出一個畫面:機械臂抱著重物的同時,嘗試去拉開冰箱門。這在外觀上似乎「合理」,但在物理世界中卻荒謬至極,因為它違反了最基本的「兩隻手不能同時做兩件事」的時空約束。 這暴露了當前技術路線的關鍵瓶頸:**高保真度的視覺流暢性,掩蓋了對物理因果律與行動序列邏輯的深刻無知。** 機器人能夠「看」懂畫面,但卻無法據此「做」出連貫的動作。要從「生成」跨越到「規劃」,徐丹飛認為,必須具備兩個核心要素:一是具有強大泛化能力的先驗知識表達;二是一種能夠在測試階段、以目標為導向進行動態組合的機制。 #### 積木式思維:因子圖與技能的可組合性
為了破解長流程任務與複雜物理約束的難題,徐丹飛提出了他的破局思路——「組合式世界模型」。這個概念的核心思想,源自人工智能先驅馬文·明斯基的啟發:將複雜系統解耦為簡單的模塊化組件。 他比喻道,我們應該讓機器人學會一系列「基礎技能」,就像搭積木一樣。關鍵在於,這些技能之間如何進行有效銜接?徐丹飛引入了一個巧妙的邏輯:前一個技能終止時的狀態分佈,必須與後一個技能成功啟動的起始狀態區間完美重疊。這個「狀態交集」,是兩個技能之間能夠順暢傳遞的「契約」。 然而,傳統的線性串聯方式效率極低。當任務鏈條變長時,信息需要在整條鏈路上進行多次震盪。為此,徐丹飛團隊將結構擴展為**「因子圖」(Factor Graphs)**。這個工具允許研究人員在空間和時間維度上同時定義多種約束條件:
* **空間維度**:精確約束機械臂末端與目標物體間的相對位置與姿態。 * **時間維度**:確保物體在移動過程中與機械臂姿態的動態同步。 * **多臂協同**:無需專門訓練大量的雙臂協同數據,只需訓練好單臂技能,然後在測試時通過因子圖動態約束兩個單臂模型進行組合即可。 這種方法展現了強大的潛力。在演示中,機器人能夠通過因子圖的即時調度,完成過去需要特定數據訓練才能實現的複雜任務,例如雙手協同抬起沉重的雙耳鍋並精確旋轉角度,或者左手遞出錘子、右手精準接住並完成敲擊。**這標誌著機器人規劃進入了一個「模塊化時代」,其核心不再是死記硬背技能序列,而是在現場動態拼裝解決方案。**
#### 揭開斷層真相:時間注意力與策略引導
在研究過程中,一個更棘手的工程問題浮出水面:即使世界模型預測出了完美無瑕的未來視頻,機器人的底層控制器卻無法跟隨。徐丹飛將此歸因於**數據的結構性失衡**。視頻大模型吸收了互聯網上海量的視覺數據,泛化能力極強;而機器人的底層動作(Action)數據,因其獲取成本極高、場景單一,嚴重匱乏。 這導致了一個有趣的現象:視頻生成模型已經成功泛化到了新場景,但控制模型卻停滯不前。為了量化這個「視頻-動作斷層」,徐丹飛團隊提出了一個全新的診斷指標——**時間注意力比例(Temporal Ratio)**。這個指標用於衡量機器人的控制模型在決策時,究竟把注意力分配給了「預測的未來畫面」還是「眼前當下的傳感器數據」。 通過大量的實驗,他們發現了一個重要的規律:當機器人處於「接近目標」(Reaching)階段時,它需要預測未來軌跡,因此對未來的注意力佔比顯著偏高;而一旦進入物理接觸與抓取的「操控階段」(Grasping),模型會將大部分注意力瞬間拉回到當前幀,轉而依賴實時的觸覺與視覺反饋進行微調。 基於這一洞察,徐丹飛提出了**「策略引導」(Policy Guidance)**的解決方案。在測試階段,可以根據機器人實時的狀態,動態調整其注意力權重:在接近目標時,強化模型對未來的預測;在接觸物體的瞬間,強制拉回注意力,專注於當下的微調。這一方法顯著提升了機器人在面對分佈外(OOD)複雜任務時的真實執行成功率,證明了僅有視覺預測是不夠的,必須要有一個**智能的、可調度注意力的規劃器**來指導行動。 #### 反思與前瞻:失敗數據的價值與模型的分立架構
在演講後的問答環節,徐丹飛進一步分享了他對行業爭議的思考。當被問及訓練數據中「失敗樣本」的價值時,他表示,目前業界偏愛成功數據,是因為缺乏一個能高效利用「失敗」的規劃器。他認為,**能夠精準預測「某種動作會導致失敗」的模型,其安全價值遠高於僅僅預測成功。** 未來,有意識地收集並利用失敗軌跡,將是拓展世界模型安全邊界的關鍵。 而針對學術界一個核心爭論——「世界模型是否應與策略模型融合為一體」,徐丹飛給出了明確的立場:應保持兩者分立。他提出了兩點支撐性理由:
1. **欠擬合問題**:目前模型容量遠未飽和,視頻數據與動作數據的規模和分佈迥異。強行融合會讓一個本就難以收斂的世界擬合任務,再額外背負控制任務,大幅增加預訓練的難度。 2. **數據利用方式不同**:策略模型需要精準、高質量的成功數據(適合SFT或強化學習微調),而世界模型需要吸納海量、多樣的失敗與邊緣數據來構建完整的世界認知。將兩者解耦,各司其職地進行針對性優化,才是當前更為高效和穩妥的技術路徑。 **規劃的本質,遠不止是在腦海中播放一部流暢的未來電影。** 徐丹飛的演講如同一面鏡子,映照出演算法與物理世界之間那道名為「規劃」的鴻溝。他的組合式世界模型及其對「視頻-動作斷層」的深刻剖析,為機器人領域指明了一個關鍵方向:未來的突破點,不在於生成更逼真的畫像,而在於發展出更強大的**測試階段組合機制**與**精準的物理邏輯推理能力**。只有當機器人的預測與動作在真實世界的物理約束下實現精準對齊時,世界模型的潛能才算真正被釋放。
Related
相關文章

OpenAI 和 Anthropic,正在砸錢搶這個市場
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

奧特曼馬斯克豪言:我們已進入奇點,AGI加速窗口已至
這篇消息聚焦「奧特曼馬斯克豪言:我們已進入奇點,AGI加速窗口已至」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

AI 大模型周榜:Kimi K3 蟬聯前端開發榜全球第一、智能體榜表現突出
首頁 > 智能時代>人工智能 AI 大模型周榜:Kimi K3 蟬聯前端開發榜全球第一、智能體榜表現突出 2026/7/27 16:35:22 來源:IT之家 作者:小泵 責編:小泵 評論: IT之家 7 月 27 日消息,Arena(arena.ai)平臺今日發佈了 2026 年第 30 周的 AI 大模型排行數據,統計週期為 2026-07-20 ~ 2026-07-26。

三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報新智元·2026年07月27日 16:01八月的模型戰場,硝煙已經點燃 GPT-6和Fable 5.1,已經準備就位,很可能8月上線。 據悉,本週奧特曼已經突降華盛頓,展示了OpenAI有史以來的最強大模型——GPT-6。 據外媒Axios爆料,GPT-6 已經具備了進行原創科學研究的能力,並在內部測試中通過不休不眠的智能體集群(Agent Swarms),展現出危險的長程規劃與自主滲透能力。 而就在同一時刻,Anthropic這邊也有消息洩露:Fable 5.1 已經就位,瞄準 8 月,加量不加價,試圖以田忌賽馬戰術,在GPT-6落地前完成狙擊。 這個8月,註定不平靜,一場肉搏戰即將打響,目標直指ASI的奇點時刻。 Anthropic的暗中狙擊:Fable 5.1已準備好,等待一擊斃命 Anthropic 顯然已經嗅到奇點逼近的氣息。 業內爆料證實,Anthropic 籌備已久的 Fable 5.1 已經完成內部測試,瞄準 8 月發佈。 並且,它的定價將維持與Fable 5完全相同(輸入 $10 / 輸出 $50 每百萬 Token)。

Claude Code狂刪80%提示詞,Opus 5反手加回去了
Anthropic 在 Claude Code 中刪除了 80% 的提示詞,但隨著更強大的 Opus 5 模型推出,這些提示詞不僅被全數恢復,還新增了更多規範,導致「模型越強、規矩越多」的現象。業界分析認為,這反映出 Anthropic 在提升模型能力與維持使用行為可控性之間的反覆權衡,後續提示工程反而走向更嚴謹複雜的路徑。