世界模型開始嚴測

2026年8月30日 00:00
站內 AI 整理稿

世界模型正從概念展示走向嚴肅評測,近期陸續出現多個針對不同領域的專用基準,試圖以更嚴謹的方式檢驗這類模型對真實世界的理解程度。過去對影片生成模型的評估,多半聚焦在畫質好壞、畫面連貫性是否流暢,但這些指標往往只能反映模型輸出「看起來合不合理」,卻難以判斷模型是否真正掌握物理世界的運作規律。隨著世界模型逐漸從實驗室走向實際應用,學界與業界開始意識到,需要一套能從統計與因果層面進行衡量的新方法,於是各種面向特定任務的評測基準應運而生。其中,PAWBench 以「概率對齊」為核心,專門檢驗影片生成模型對真實世界動態的掌握程度。

這個基準的設計理念在於,傳統評測方式側重於視覺品質,卻忽略了模型輸出的機率分布是否與實際物理規律一致。舉例來說,一個模型可能生成一段畫面流暢、光影自然的影片,但在物體運動軌跡、碰撞反應或速度變化等細節上,卻與真實世界的統計特性存在顯著偏差。PAWBench 嘗試從統計層面分析模型內部對世界狀態的估計,進而判斷它是否真正理解世界如何運作,而非只是憑藉大量訓練資料拼湊出看似合理的畫面。這項基準的出現,意味著評測標準正從「看起來像真的」邁向「本質上符合真實規律」。在遊戲領域,則出現了名為 GameWAM 的動作模型評測基準。

與單純預測下一幀畫面的傳統影片模型不同,GameWAM 要求模型在理解遊戲場景變化的同時,必須同步輸出對應的鍵盤與滑鼠操作。這意味著模型不能只是被動地觀察畫面演變,還需要主動推導出玩家在當下最可能採取的輸入行為。這類測試能更具體地檢驗模型對互動環境的因果理解,因為在遊戲中,每一次操作都會引發畫面變化,模型若想做出正確的動作預測,就必須掌握「什麼原因導致什麼結果」的因果鏈條。這也讓 GameWAM 成為未來通用遊戲代理或自動化測試應用落地前的重要驗證工具,因為一個真正理解遊戲運作邏輯的模型,才有能力在複雜多變的虛擬環境中做出合理決策。

另一項值得關注的是 UrbanGround,這是一個鎖定城市智慧體的城市級基準,以香港為藍本進行虛擬復刻。該基準建構出高度貼近真實街道布局、交通規則與地標結構的模擬環境,要求智慧體在這樣的場景中執行導航任務。與過去較為簡化的模擬城市不同,UrbanGround 的設計目的是讓智慧體面對接近現實世界的複雜度,包括狹窄巷道、多層立交橋、行人穿越道與各種交通號誌,都是必須納入考量的因素。這樣的設定讓評測結果更具參考價值,因為能通過測試的智慧體,理論上也有機會應用於真實城市的各種服務。初步結果顯示,即便在如此完整的模擬場景中,遠距離導航依然是智慧體明顯的弱點。

當任務涉及長時間路徑規劃時,智慧體容易在過程中不斷累積細微誤差,起初可能只是偏離幾公尺,但隨著路線推移,這些小誤差會逐漸放大,最終導致偏離目的地。這類誤差累積的問題,反映的不只是定位技術的不足,更點出目前世界模型在空間記憶與長程推理上的瓶頸。一個具備完整世界模型的智慧體,應該能在腦中維持對環境的穩定表徵,即使遇到感知訊號暫時中斷或模糊的情況,也能依靠內部模型進行推斷;但從 UrbanGround 的結果來看,現有模型在這方面的能力仍有相當大的限制。這三個基準各自從不同面向切入,卻共同指向一個核心問題:世界模型究竟該如何被定義,又該如何被驗證?

PAWBench 從統計機率的角度出發,強調模型對物理規律的內在表徵;GameWAM 則以互動操作的預測來衡量因果推理能力;UrbanGround 更進一步,將場景拉到真實城市規模,考驗模型在長時間、多變量環境下的空間認知與決策穩定度。三者互補,構成了一套更立體的評測視角,也讓外界得以更清楚地看到世界模型目前的優勢與極限。從發展脈絡來看,世界模型的概念最早可追溯至人工智慧研究者對於「心智模型」的探討,主張智慧體若要具備靈活的決策能力,就必須在內部建立一個對外在世界的模擬機制。近年來,隨著生成式模型的爆發性成長,影片生成技術讓人們看到了世界模型的可能雛形,但多數展示仍停留在示範性質的階段。

如今,這些專用基準的出現,標誌著該領域開始進入「嚴測」時期,研究者不再滿足於欣賞模型生成的絢麗畫面,而是開始用科學方法檢驗模型對世界的理解是否真實可靠。對產業界而言,這類評測的價值同樣不容忽視。無論是自動駕駛、機器人控制、智慧城市管理,還是遊戲自動化測試,都需要一個對世界運作有深刻理解的模型作為核心。過去缺乏統一基準,各家模型的好壞難以客觀比較,也讓潛在應用方難以決定該採用哪一套技術。隨著 PAWBench、GameWAM、UrbanGround 等基準陸續建立,未來世界模型的發展方向將更加明確,哪些模型真正具備「理解」能力,哪些只是擅長生成華麗畫面的「模仿者」,將在這些嚴格的測試下無所遁形。

當然,評測基準本身也仍在摸索階段。以 PAWBench 為例,要如何定義「與實際物理規律一致」的機率分布,本身就涉及複雜的統計建模與物理知識;GameWAM 則面臨遊戲種類繁多、操作風格差異大的挑戰,同一套基準是否能涵蓋不同類型的遊戲,仍是值得探討的問題;UrbanGround 雖然以香港為藍本提供了極具真實感的場景,但單一城市的測試結果,是否能推論到其他城市的不同交通文化與街道格局,也需要更多研究來驗證。儘管存在這些待解的問題,世界模型的評測趨勢已經不可逆轉。從概念展示到嚴肅基準,代表這個領域正逐漸成熟的跡象,也反映出學者與工程師對「理解世界」這項任務的標準愈來愈高。

未來,當這些模型真正能在嚴格基準下穩定過關,或許也就是世界模型從研究論文走入你我日常應用的時刻。

Related

相關文章

何夕2077研究與前沿

LAION開放千萬小時視頻

LAION 近日發布了一個名為 BVD 的開放影片資料集,內含超過 8000 萬段影片片段,總時長達到 1000 萬小時。這項資源將提供給學術界與開發者使用,有助於進一步推動多模態 AI 模型的訓練與研究。 根據官方說明,BVD 資料集在訓練效果上表現突出,與先前的 InternVid 資料集相比,使用 BVD 訓練的模型在相關基準測試中最高可提升 2.1 個百分點。這意味著更大規模、更多元的開放影片數據,能夠有效強化模型對動態場景的理解能力。

1 天前
何夕2077研究與前沿

評測漂移被量化

評測漂移被量化。 Reddit作者在 模型波動帖子 統計 31352 個小時分���。日內波動2.8分。跨日波動8.4分,Gemini 3.1 Flash Lite一度降32%。

1 天前

Claude開始訓練Claude!4美元一小時,跑贏150美元人類研究員

! 時薪4美元,幹贏時薪150美元的人類研究員。 在Anthropic最新發布的研究中,Claude自己查論文、提方案、造數據、訓練模型,一口氣攻克了10類AI安全問題。 部分任務上,它交出的方案甚至比28名人類安全研究員更好。 更刺激的是,較弱的Claude已經開始反向參與訓練更強的Claude。

1 天前
何夕2077研究與前沿

騰訊Hy4預覽開源

騰訊宣布 Hy4 以預覽版本形式正式開源,相關程式碼與資源已對外公開,開發者與研究社群現在即可取得這套技術,搶先進行測試與評估。 從「預覽」定位來看,Hy4 目前仍處於持續調整階段,騰訊後續可望依據社群回饋持續優化,再推出正式版本。選擇以開源方式釋出,也讓外部團隊得以深入檢視技術實作細節,有助於擴大生態系的參與程度。 對開發者而言,現階段正是探索 Hy4 功能、評估整合路線的時機。

2 天前
何夕2077研究與前沿

WikiSkill沉澱經驗

在大型語言模型快速演進的同時,如何有效累積與复用執行經驗,已成為提升模型能力的關鍵課題。近期一項名為「WikiSkill」的技術路線受到關注,其核心概念是將模型在實際任務中的執行經驗,以條列式、結構化的方式寫入維基格式的知識庫中,讓技能不再停留在一次性嘗試,而是能反覆更新、持續被後續任務引用。這種作法強調從「做中學」的動態回饋,而非僅依賴靜態的訓練資料,為模型在面對新任務時提供更具依據的決策支援。

2 天前