不堆 Transformer,斯坦福吳佳俊如何用物理重新定義多模態融合?|ECCV 2026

2026年9月11日 09:39
站內 AI 整理稿

視覺、聽覺、觸覺三種數據,其實是同一組物理屬性在不同感官通道上的投影。作者丨陳淑瑜 編輯丨岑 峰 2026年9月8日,歐洲計算機視覺會議 ECCV 在瑞典馬爾默召開。在 9 月 9 日的“ Embodied Multimodal Reasoning in Physical Environments(物理環境中的具身多模態推理)”專題分場上,斯坦福大學計算機科學助理教授吳佳俊發表了一場橫跨視覺、聲音與觸覺的演講。這已經是吳佳俊兩個月內的第三場重要演講,而每一場的切入口都不同。

8月20日,他在德國不來梅領取了 IJCAI 2026“計算機與思想獎”,發表獲獎演講《Building Visual and Physical Intelligence Through Code》, 彼時他系統性闡述瞭如何將經典符號 AI 的幾何、物理先驗定義為“物理代碼”,並與現代基礎模型深度縫合,鋪就了一條從“看懂畫面”到“具身動作交互(4D)”的全新物理智能範式。

9月8日,他在 ECCV 期間的“Robotic Manipulation Research”Workshop 上轉向了操作與規劃:讓基礎模型自動發現“原子技能”及其前置與後置條件,構成可組合的抽象,使機器人能從極少演示泛化到長程任務,並配套一系列評測基準。而9月9日這場,他換了一個方向。前兩次的路徑都是“從視覺出發,往下游延伸”——先理解世界,再去規劃與操作;這一次則是在感知端橫向拉平: 將視覺、聽覺、觸覺視為同一組物理屬性在不同觀測通道上的投影。舉例來說,一個塑料物體,看起來像塑料,摸起來像塑料,敲起來也像塑料。

他要回答的是一個更前置、也更難的問題:當我們幾乎沒有任何數據時,怎樣把這三種模態融在一起?在這場多模態感知的演講中,吳佳俊沒有沿用“把視覺、音頻、觸覺拼起來餵給 Transformer”的常規做法,也沒有退回“先估計狀態、再跑物理仿真”的經典路徑,而是給出了一個更前置的答案:用同一組物理屬性,為三種感官建立共同的座標系。吳佳俊直擊當前多模態融合的痛點:進入新領域、面對從未見過的物體時,聲音與觸覺的數據幾乎為零,真正稀缺的不是架構而是原則。

他系統性闡述瞭如何把幾何、材質與剛度這類物理屬性,既作為從視頻擴散模型中蒸餾出的學習目標(PhysDreamer),又作為條件化生成模型的中間接口(WonderPlay),並進一步延伸到聲音的可微分渲染(DiffImpact、RealImpact)與柔性電子皮膚(DexSkin),鋪就了一條從“看懂畫面”到“聽出材質、摸出力度”的跨模態物理智能範式。

以下是吳佳俊在 ECCV 2026 期間發表的演講精編稿,AI 科技評論基於其演講內容進行了不改原意的翻譯編輯:▎《Physics-Grounded Multimodal Perception:從視覺、聲音到觸覺的統一物理底座》主講人:吳佳俊(Jiajun Wu),斯坦福大學01當數據極少時,模態該怎麼融這部分講的是多模態感知,所以我想還是講點跟多模態相關的內容。於是我回去翻了翻我們自己的工作,幾年前做過的一些聲音研究現在回看依然很有意思,我自己還想再往前推一推,所以也打算一併講講。視覺是一部分,我們也會講到觸覺,另外還有聽覺。

問題在於,怎麼把這些多感官信息融合起來,構建出更好的表示,從而幫我們做感知和操作?要把這些信息融合起來,你總得有某種原則。視覺和聽覺該怎麼配?聽覺和觸覺又該怎麼配?當然,你可以直接上 Transformer,這也是現在大家普遍的做法,某種意義上效果也確實不錯。但有時候我們會想,能不能做得更好一點,尤其是當手上數據非常少的時候。如果我們進入一個全新的領域,面對從沒見過的物體,關於它們的聲音、它們的觸覺響應,我們幾乎沒有數據。這是我們一部分工作的出發點。

所以正像標題裡寫的,我們想的是:能不能把這件事做得更有物理根基一些,讓底層的物理規律來指導多模態感知模型的設計,哪怕最後我們還是用 Transformer 之類的結構把它們融合起來。02同一組物理屬性,支配著所有感官先說圖像。我們會依次講圖像、聽覺和觸覺,但從圖片開始。你看到一張圖片,就知道這裡面一定有底層規律在起作用。我們看到這頭獅子,是因為它有幾何、有材質、有運動。這裡重要的是,我們要關心的其實是同一組物理屬性,可能是幾何,也可能是材質;而支配其他類型觀測的,也正是這同一組屬性。你可以有觸覺觀測,也可以有聽覺觀測,它們全都源自同一套底層物理。

舉個例子,如果一個物體是瓷做的或者塑料做的,那它看起來像塑料,摸起來像塑料,敲起來也像塑料。所以同一組底層屬性,其實在幫我們引導不同感官模態的感知過程。03視覺即逆圖形學,但今天有了更好的工具這裡是 ECCV,所以我們本質上還是在解決計算機視覺的感知問題。歷史上人們常說,視覺就是逆圖形學,也就是把圖形學的渲染過程反過來,從感官觀測中恢復出那組物理屬性。我們先花點時間聊聊視覺。在推進這條線的過程中,我們嘗試過幾種不同的範式,來把物理和感官觀測結合起來。我們特別在思考的是,怎麼藉助這些基礎模型?它們正變得越來越強,每天都在變強。

既然它們能做的事越來越多,我們自然要問:我們關心的那些物理屬性,能不能從中拿到?現在人們說基礎模型,越來越多指的是語言模型。但此前也有別的基礎模型,比如視頻擴散模型,還有大量視覺語言模型。具體到我們關心的這類底層特徵,比如物體幾何和物理屬性,我們花了不少精力研究一個問題:到底能從視頻擴散模型裡蒸餾出多少東西?既然它這麼擅長生成漂亮的圖像和視頻,那它一定捕獲了某些關於物體幾何和物理屬性的知識,我們能不能把它挖出來?04PhysDreamer:從視頻擴散模型裡“掏”出楊氏模量我先舉幾個例子,說說這類工作是怎麼做的。我們最早的嘗試之一,是從視頻擴散模型中提取物理屬性,用來對動態物體建模。

這項工作發表在 ECCV 2024,也就是兩年前。問題是這樣的:你想做動作條件下的三維物體動力學預測,從一個靜態的 3D 場景出發,比如一朵花,然後推理它的物理屬性,讓它變得可動、可交互。這是 ECCV 2024 的口頭報告。你要做的是動作條件預測,輸入不同的動作,下面這些結果全都是我們方法的輸出,輸入和場景完全一樣。但只要你估計出了物體的物理屬性,就應該能預判物體會如何響應你施加的不同動作。這裡的挑戰在於,我們真的能感知到物體的物理屬性嗎?幾何、材質當然都算物理屬性,但在動作條件預測這個場景下,你真正關心的是更狹義的那一類,也就是密度、剛度這類傳統的物理量。

其中最關鍵的是,我們要怎麼估計楊氏模量,也就是物體的剛度?實際上這個問題可能比你想象的更難。即便只是一朵花,花有不同的部分,它是非均質的,不同部分的物理屬性並不一樣。所以如果你基於啟發式規則隨便賦予物理屬性,再跑仿真,得到的就是明顯不真實、而且帶有很大隨機性的物理行為。這其實是一個高維空間,哪怕只是一個楊氏模量場,要估計的也是一個高維場,就算多次採樣,結果也不太好看。而且我們顯然沒有這類真值數據。很多東西你都能收集到大量數據,比如用 Blender 這類軟件可以拿到大量專家軌跡。但底層物理屬性的估計不一樣,我們沒有密集標註:花瓣的楊氏模量到底是多少?這種數據根本不存在。那怎麼才能得到好的估計?

我們的想法是,從預訓練的視頻擴散模型裡蒸餾。兩年前做這項工作的,一位是 Tianyuan,他是 MIT 的博士生,剛畢業去了 Meta;另一位是 Koven,我在斯坦福的博士生。我們具體做了什麼呢?即便用當時還不夠好、遠不如今天的視頻擴散模型,我們依然拿到了一些有意思的結果。思路是這樣的:用 3D 高斯表示場景,把它渲染成圖像,再送進視頻生成模型做圖生視頻,得到一段參考視頻;同時有一個待估計的楊氏模量場。把外觀場和物理屬性場拼在一起,送進一條可微分的 3D 表示管線。

當時我們用的是可微分物質點法,也就是 differentiable MPM,它最初來自計算機圖形學社區,非常容易和 3D 高斯結合。讓它們通過可微分仿真,就能得到物體的仿真軌跡,再渲染成視頻。剛才說了,如果物理屬性的初始猜測不準,渲染出來的視頻也不會真實。但現在你有了一段參考視頻可以對比,就能得到一個損失。有意思的是,即使你只是在像素空間上算損失,它也能給你很多有用的信息,因為這裡一切都是可微的。這些信息可以反向傳播回去,讓你把物理屬性的估計更新成“為了讓仿真視頻和生成視頻匹配,它應該是什麼樣”。這個範式非常簡單,雖然已經是兩年前的事了。

這兩年很多東西都進步了,我們也做了後續工作,不再在像素空間算損失,因為那樣比較脆弱。我們開發了一些方法,有點像 SDS,也就是分數蒸餾採樣,在視頻上做同樣的操作,就得到估計的 4D 表示。這條線我們其實沒有繼續往下做,但第一個工作我覺得依然很有意思,因為它用一個非常簡單的範式說明了一件事:你可以通過推動基礎模型,從中取出物理屬性的估計。隨著模型越來越強、蒸餾方法越來越好,你會拿到更好的結果。因此,我們不僅能給花估出不錯的物理屬性,對別的可變形物體也行,因為 MPM 這種仿真方法特別適合軟體。

還有一件有意思的事:因為這裡的場景非常簡單,我們其實可以拿到真值,拿真實採集的花朵運動跟我們方法估計出的運動對比,我們方法的輸出比基線要真實得多。05物理現象的通用建模從那以後,我們做了一系列後續工作,比如改用其他類型的優化、用更好的擴散模型、擴展到更通用的場景。我特別想講其中一個延伸點:我們一直在努力把建模對象從“只有可變形物體”,擴展到更通用、更多樣的物理現象。現實世界裡,或者說虛擬廚房裡,並不只有物體,還有不同狀態的物質:顆粒、流體、剛體、軟體、關節物體。這些不同類型的東西,怎麼用一個統一的系統全建模起來?

這就是我要講的第二項工作的目標:從單張輸入圖像出發,重建出 3D 場景,並且讓它可動、可仿真,也就是你可以通過施加動作讓它具備交互性。比如這個場景裡有一個剛體,就是這隻橡皮鴨。那麼你能對它施加什麼動作,讓它跟下面的流體發生交互?這是去年的工作,叫 WonderPlay,它能讓你從單張圖像得到可動、可交互的 3D 場景。這些動作是在 3D 空間裡定義的,比如你可以設一個力場,把那根棍子往左往右拖,就能看到蜂蜜和蛋糕之間的交互;也可以設一個從左邊吹來的風場,能看到帽子、頭髮還有煙的運動。這裡的思路是這樣的。傳統做法是做狀態估計,再做物理仿真,但這顯然不夠。

因為即便估計完美,仍然有很多東西我們根本不知道怎麼又快又準地仿真,流體和剛體的交互極其複雜,你不得不做大量近似。更麻煩的是,它還假設我們有完整的狀態估計,而狀態估計本身就非常難。我們前面剛花時間討論怎麼估計楊氏模量這一個物理屬性,而這裡你卻需要完整的物理狀態和幾何,從單張圖像裡怎麼拿到這些?觀測實在太有限了。06視頻模型吃不下細粒度動作那麼,我們能不能處理這種不完整的信息?有一個仿真器的好處是,它天生支持動作條件預測:我有一個狀態,我有一個動作,不管這個動作怎麼指定,我都能預測會發生什麼。

相比之下,視頻模型恰好是互補的:它們有大量視覺先驗,所以能從信息嚴重缺失的輸入出發,把場景補全,給你一個它們從沒見過的場景。但這類生成式方法也有侷限。儘管進展很多,比如 World Labs 剛發佈的 Atlas,號稱極其通用,輸入圖像、語言、多視角圖像,生成視頻,什麼都能做,但有一件事人們至今仍然做不到:不管是 Genie 還是 Atlas,不管什麼模型,它們依然真的沒法接受各種細粒度的動作作為輸入。這從根本上跟數據類型有關。

不管你訓練的是多視角擴散、自迴歸擴散 Transformer,還是什麼別的架構,你手上的數據大量是視頻,而對應的“動作”也只能是配得上這些視頻的動作,其中很多是導航指令,因為你可以從無人機或者遊戲裡採集到。所以這些模型能接受導航指令,也能接受語言作為輸入。語言在某種意義上確實能指定某些動作,但要指定到很細的粒度,你是真的很難說清楚。舉個例子,假如我現在握著這支麥克風,在做靈巧操作。假設我用的是一隻靈巧手,我的手和這個物體之間有多個接觸點,只要我手的位置稍微變一點,某個接觸點稍有變化,麥克風可能就掉了。我當然不想讓它掉下去。可以看到,動作空間本身是高維的,而這類數據極難採集。

現在機器人領域大家採集了多得多的第一人稱數據,但這也正是為什麼人們要花這麼大力氣從第一人稱視頻裡估計手部姿態,因為存在大量遮擋,接觸點非常難估計;而人實際施加的具體動作,尤其是這種低層級動作,也很難明確指定。所以問題又回到數據:誰手裡有這些數據?視頻模型能接受語言和導航指令,卻很難接受細粒度動作。但反過來說,如果你真有細粒度動作輸入,這類模型是可以免費吃下去的。不過你可以看到,這兩者在某種程度上是互補的。既然互補,我們就想,能不能把它們結合起來,構建一種混合式的、視覺與物理並重的生成模型?

思路是:基礎模型可以幫你蒸餾出物理屬性,但你不必只把它們當作輸出,還可以把它們當成一個接口,用來更好地條件化和控制這些生成模型。這有點像現在我能用 Blender 生成各種場景,你可以把 Blender 看成一個仿真器,只不過是用大語言模型來輸出你需要的幾何、相機位姿之類的參數,去控制它。而現在我們想讓生成模型也能接受細粒度動作作為輸入,動作可以用物體幾何來指定,比如以深度圖或者光流的形式。怎麼才能讓基礎模型接受這些更細粒度的動作?這就是目標。所以你仍然要估計物理屬性,但反過來把它們當作條件,用來更好地控制基礎模型。

07WonderPlay:把仿真器的輸出,塞進生成模型當條件在去年發表的 WonderPlay 裡,我們的目標就是構建這樣一個混合式生成仿真器。舉個具體的例子:假設我們有一張單圖,想把它變成 3D 並讓它可動,靠的就是這個思路,把物理仿真方法和視頻生成方法結合起來。做法是,先對這張單圖做一些 3D 重建。3D 重建本身就很難,你不可能拿到完整的狀態估計,因為遮擋和信息缺失都很嚴重。但即便重建得不完美,你仍然可以把它作為物理仿真方法的輸入,得到一個粗略的仿真結果。你會看到很多物理上的瑕疵,看起來不真實,也會有視覺上的瑕疵。但它們給了你一個大致的直覺:物體之間大概應該怎麼交互。

於是你可以把它們當作條件。也就是說,現在我知道物體之間大致該怎麼交互了,那我就把深度圖或者光流作為條件餵給視頻生成模型,對它做後訓練,讓它以這些為條件,輸出卻真實得多的視頻。你甚至可以對多個視角都這麼做,因為仿真結果是 3D 的,可以渲染到不同視角。但它畢竟只是一段視頻,沒有底層的物理表示。所以如果需要,你還可以進一步拿這些生成的視頻去重新優化底層的物理表示。優化之後,它既仍然是一個 3D 的物理表示,從不同視角看都成立,也能接受風這樣的動作作為輸入,同時又因為這些視頻提供了監督信號而看起來真實得多。

這就是核心思路:把物理仿真器和視頻生成器放在一起,支持剛體、軟體、顆粒物體、剛體與流體等多種多樣的物理交互。而且因為它是動作條件的,你可以從同一張圖像出發轉成 3D,再施加不同的 3D 動作,看它如何響應。我們也一直在思考怎麼把它用到機器人上。如果你能做動作條件生成,你就會得到 3D 物體流,也就是物體隨時間的稠密跟蹤,這可以直接作為機器人的模仿目標。我們還在設法讓這套系統更加實時,以便集成進真實的操作工作流。08聲音:為聽覺也建一條可微分渲染管線怎麼把這種基於物理的建模表示從基礎模型裡取出來,又用它們反過來更好地控制基礎模型。但剛才說的都是同一組物理屬性。

而這同一組屬性,其實也支配著你可能觀測到的其他感官數據,不只是視覺,還有聽覺和觸覺。它不只告訴你物體從不同視角、不同光照下看起來什麼樣,告訴你戳一下會怎樣、它會怎麼表現,還告訴你它會發出什麼樣的聲音。因為說到底,決定“我戳這個東西會發生什麼”的,是那組物理屬性;在你和它交互時產生聲音、給你觸覺反饋的,也是同一組屬性。所以很長時間以來我們都在思考一個問題,雖然聲音的工作是幾年前做的,但我們想把它們重新撿起來:同一組物理屬性,如何幫助我們理解來自不同模態的感官數據。舉個例子,如果你有幾何、有物理屬性,你就會意識到,物體之所以發聲,是因為它會振動;而它之所以那樣振動,是因為它有一套固有的振動模態。

也就是說,幾何和剛度實際上支配著物體底層的振動模態,這就是你在 3D 裡可視化它的方式。而物體發出的聲音,基本可以寫成這些不同模態的線性組合,各自帶上相應的權重。這項工作是我們在四五年前做的,叫 DiffImpact。我們搭建了一條可微分的渲染管線,只不過是為聽覺做的,基於底層的振動頻率模態,以及對應的阻尼係數和增益。所以你可以看到,這是一條可微分渲染管線,就像 NeRF 和高斯在視覺數據上做的那樣。那麼有了這條可微分渲染管線,你能做什麼?在視覺上,如果你有一條可微分渲染管線,就可以對著視覺觀測做優化,反推出底層的物理屬性。同樣的道理,面向聽覺也可以這麼做,從而從聲音中推斷出物理屬性。

舉個例子,這裡有一隻陶瓷馬克杯,還有一段真值頻譜,也就是實際錄到的聲音。我們知道這個聲音可以寫成衝擊力和衝激響應的卷積,於是基於你對力和振幅的估計,就能合成出一段波形,再拿它和觀測到的頻譜做優化。整個流程是可微的,所以反向傳播之後你能得到估計出的衝擊力,也就是撞擊發生在哪裡,以及衝激響應。09RealImpact:錄製一個物體的“聲場”我們還做了大量更系統的研究,把這套東西延伸到更嚴謹的實驗設置裡。比如幾年前我們在想:在一個消聲室裡,沒有混響,我們能不能不只建模物體的振動模態,還進一步思考聲音如何傳播,去建模物體的聲場?

作為早期工作的後續,我們額外嘗試錄製單個物體的聲場:用衝擊錘敲擊物體,同時用裝在機器人龍門架上的麥克風陣列,從房間裡不同的位置持續錄製。如果你們去我們的項目網站看看(網站是 Samuel 做的,他已經畢業,在特斯拉),會發現其實能聽出非常細微的差別:同一個物體在房間不同位置發出的聲音略有不同,因為不同的振動頻率模態傳播到房間不同部位的方式也不一樣。這個數據集我們叫 RealImpact,取的就是“真實撞擊”的意思。我認為它可以作為一個基準,讓你思考:拿聽覺這類感官模態去做優化,到底能拿到多少信息、能推斷出多少物體的物理屬性。

後來我們還做了一些延伸,基於這些信息,假設你面對的不是物體而是一個揚聲器,那麼只要聲場建模得足夠好,一旦房間裡有一個人,聲場就會改變。我們已經證明,神經網絡確實有可能從錄到的聲音裡推斷出房間裡有沒有人,因為人的存在會擾動聲音的傳播,讓聲場發生細微變化。所以,如果你有一個很響的揚聲器在放音樂,同時有一個麥克風在錄音,那麼房間裡有沒有人,其實可以根據樣本里這些細微差異反推出來。這可能有好的用途,也可能有壞的用途,但本身是個挺有意思的發現。10DexSkin:10 美元的電子皮膚最後,同一組物理屬性,讓你能做視頻生成、動畫、聲場傳播建模,也會給你觸覺響應。

所以我們也在思考,能不能在觸覺感知上做更多事情,尤其是面向機器人操作。我們過去在這個方向上做過大量工作,主要是基於 GelSight,也就是 MIT 的 Ted Adelson 組開發的觸覺傳感器。不過這些我都不打算講,我要講我們最新的工作,去年剛發表的,也可能是今年。傳感器有不同類型。GelSight 分辨率挺高,但不夠耐用,用上一兩百次就會看到凝膠明顯漂移,只能再訂一個新的;而且它有點貴,要好幾百美元。磁傳感器成本倒是低,但很難做成不同

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

7 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前