研究實錘:世界模型根本不懂物理定律,屬於它的“ChatGPT時刻”還很遠

2026年7月29日 12:47
研究實錘:世界模型根本不懂物理定律,屬於它的“ChatGPT時刻”還很遠

重點摘要

近年來,基於視頻生成的世界模型(World Models)被視為通往通用人工智能的關鍵路徑之一。從 OpenAI 的 Sora 到 Google 的 Genie,再到 Cosmos 和 V-JEPA,這些模型都承載著一個共同的宏偉假設:只要看過足夠多的視頻數據,AI 就能夠自發湧現出對物理世界的直覺,進而像人類一樣理解並模擬物體運動的規律。 然而,一個根本性的問題始終困擾著學術界:這些模型真的理解了物理定律嗎?

站內 AI 整理稿

近年來,基於視頻生成的世界模型(World Models)被視為通往通用人工智能的關鍵路徑之一。從 OpenAI 的 Sora 到 Google 的 Genie,再到 Cosmos 和 V-JEPA,這些模型都承載著一個共同的宏偉假設:只要看過足夠多的視頻數據,AI 就能夠自發湧現出對物理世界的直覺,進而像人類一樣理解並模擬物體運動的規律。然而,一個根本性的問題始終困擾著學術界:這些模型真的理解了物理定律嗎?它們生成的畫面是基於對牛頓力學的內在推理,還是僅僅憑藉高超的模式匹配能力,製造出了一種“看起來正確”的幻覺?

為了回答這個問題,南洋理工大學 S-Lab 團隊聯合合作者,提出了首個以經典物理定律為核心的視頻模型評估基準——Apple-π。研究結果給當前火熱的視頻生成領域潑了一盆冷水:即便是在最前沿的 SOTA 模型中,其綜合得分也僅為 0.473。研究團隊直言,世界模型的“ChatGPT 時刻”依然遙遠。## 蘋果背後的物理拷問

為什麼要專門為視頻模型設計一套基於物理定律的考試?研究團隊指出,現有的評估基準存在明顯的盲區。傳統指標要麼只關注畫面的像素相似度、剪輯質量或文本匹配度,要麼只能判斷視頻“是否合理”,卻無法驗證其“為何合理”。 這就好比一個學生能背出蘋果會落下,卻不知道背後是萬有引力在起作用。目前的視頻模型很可能只是“亞里士多德”式的直覺大師,而非“牛頓”式的物理推理者。 Apple-π 基準的命名頗具深意,它錨定在蘋果落地的經典物理場景之上,旨在系統性地考察模型能否真正感知物理量、表述支配定律,並推導出符合定律的後續運動。更關鍵的是,它還能定位推理失敗究竟發生在哪一步。 ## 基準拆解:從感知到推導的嚴苛考驗

Apple-π 的核心由三部分構成:視頻數據集 Orchard、基準協議和評估套件。 首先,**Orchard 數據集**包含了 400 個精心設計的經典力學視頻。這些視頻涵蓋重力驅動運動、動量守恆碰撞、牛頓第一定律(慣性)以及多段運動的複雜組合。為了屏蔽模型的先驗知識,所有視頻均採用簡單的幾何體(球體、立方體等)在固定相機視角下運動,並在第一幀提供精確的物理量標註。 其次,**基準協議**將任務劃分為感知、表述和推導三個層級,共五個子軌道:

- **感知-文本**:要求模型讀取畫面中的數值和文字標註。 - **感知-圖形**:要求模型定位並圈出實驗物體。 - **表述-文本**:要求模型從候選公式中選擇正確的物理方程並代入變量。 - **表述-圖形**:要求模型預測特定時刻物體的位置並標註速度向量。 - **推導**:基於首幀初始條件,生成完整的後續運動視頻。 這一設計能夠精確診斷模型的短板:它是看不清標註、選不對公式,還是根本無法正確模擬運動? 最後,在**評分機制**上,Apple-π 結合了多模態大模型評分與物理真值指標。對於有明確物體掩碼和軌跡真值的任務,系統會量化物體定位誤差、軌跡偏差和速度誤差,確保評價不僅僅停留在“看上去很美”。 ## 模型集體“掛科”:物理推理成為瓶頸

研究團隊對 11 個具有代表性的模型進行了全面評估,涵蓋了專有模型、開源視頻模型以及多模態大模型。結果令人震驚:所有模型的平均得分均不理想,即使是最先進的 SOTA 模型,總得分也僅為 0.473。 通過對子任務的拆解,研究發現了幾個關鍵現象:

1. **感知有餘,推理不足**:許多模型能夠完成基本的標註讀取和物體定位(感知任務),但在進行物理規則選擇、狀態更新以及後續運動預測時,表現急劇下降。 2. **缺乏穩定的物理建模能力**:大規模、高質量的視頻訓練確實能夠蒸餾出一些有用的物理先驗,使得專有模型和經過視頻推理微調的模型(如 VBVR-Wan2.2)表現相對更好。但整體而言,模型依然更多依賴於表層的視覺模式匹配,而非真正的因果推理。 3. **中間推理環節是最大黑洞**:Apple-π 的細粒度測試明確指出,模型的錯誤並不只是出現在最終的視頻生成階段,在“表述”層面(即選擇和理解物理公式)就已經出現了顯著缺陷。這說明模型在根本層面上缺乏將視覺輸入轉化為物理符號運算的能力。 ## 侷限性與未來方向

當然,作為一個新興基準,Apple-π 也存在一定的侷限性。目前其覆蓋範圍僅限於經典剛體力學,尚未觸及流體、熱力學、電磁學或更復雜的生物運動。場景僅限於簡單幾何體和單一固定相機視角,未測試多視角一致性。此外,評估方式仍受制於 MLLM 裁判的判斷誤差以及視頻生成服務的時長不穩定性。 儘管如此,該研究為行業指明瞭一個清晰的方向:如果世界模型想要成真,僅僅通過擴大數據規模和算力是不夠的。研究人員需要為視頻模型賦予更強的場景理解能力、更豐富的物理推理數據,以及專門針對物理邏輯推理的後訓練。 在通往通用世界模擬器的路上,“刷題”或許能帶來高分,但只有真正學會“物理定律”,才能迎來屬於世界模型的“ChatGPT 時刻”。而 Apple-π 就像一面鏡子,照出了當前行業在光鮮視頻背後的基礎能力缺失。這條路,顯然還很長。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

10 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

11 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

15 分鐘前