李飛飛押注的空間智能:生成的世界,如何「經得起折騰」?
AI 生成的世界看似繽紛,卻往往「中看不中用」。究其根本,問題可能在於 AI 少了一本「底账」——一份完整記錄世界裡有什麼、每次交互或行動改變了什麼、並且能被隨時檢查與回滾的狀態日誌。沒有這份底账,AI 生成的三維場景只是浮於表面的視覺幻象,缺乏真正可被操作、可被驗證的內在邏輯。這正是當前生成式 AI 從「畫圖」走向「造世界」時,最容易被忽略、卻也最關鍵的技術瓶頸。近年來,以生成對抗網路、擴散模型為代表的生成式 AI 在二維影像領域取得了令人矚目的進展。從高解析度的人物肖像到風格多變的風景畫,AI 已經能夠在短短幾秒內產出足以以假亂真的視覺內容。
然而,當研究人員嘗試將這套能力延伸到三維空間時,卻發現情況遠比想像中複雜。一張靜態圖片可以靠像素之間的統計規律來生成,但一個可互動的三維世界,必須遵循物理法則、保持空間一致性,並且在用戶介入後做出合理的回應。這對 AI 的認知架構提出了截然不同的要求。李飛飛近年押注的「空間智能」,正是被視為通往世界模型的主流路線之一。這位史丹佛大學教授、ImageNet 挑戰賽的發起人,在電腦視覺領域擁有舉足輕重的地位。她近年來多次公開表示,下一波 AI 浪潮將不再局限於二維畫面的理解,而是朝向三維空間的感知與推理邁進。
空間智能的核心構想,是讓 AI 從單純識別二維畫面,進化到理解、推理,甚至生成一個「可進入、可操作、可持續編輯」的三維世界。換句話說,AI 不只要看得懂一張圖,更要懂得一個空間裡物體之間的關係、物理規律,以及使用者介入後可能產生的連鎖反應。這個願景背後,其實隱含著一個更深層的技術挑戰。傳統的生成模型,無論是生成圖片還是影片,本質上都是在做「一次性」的輸出——模型根據輸入的條件或雜訊,直接產生最終結果。這種模式在二維領域行得通,因為圖片是靜態的,不需要考慮時間演進或因果關係。但三維世界是動態的、持續的,用戶可能隨時移動視角、拖動物件、改變光源,甚至觸發一連串的物理模擬。
每一次操作,都應該在世界狀態中留下痕跡,而 AI 必須能夠追蹤這些變化,才能維持世界的一致性。這就帶出了「狀態底账」的概念。所謂底账,就像是一個世界模型的資料庫,記錄了場景中每個物件的屬性、位置、材質、物理狀態,以及每一次交互行為對這些屬性造成的改變。有了這份底账,AI 生成的世界就不再只是一張漂亮的靜態截圖,而是一個有內在邏輯、可以被反覆檢驗的動態系統。當用戶把一個杯子從桌上推到邊緣,底账會記錄杯子的位移、速度、與桌面的接觸點;當杯子掉落地面,底账會更新它的位置、形狀變化,甚至碎片飛散的軌跡。每一步都有跡可循,每一次改變都可回溯。這項能力的重要性,在於它讓生成的世界真正「經得起折騰」。
如果沒有底账,AI 生成的三維場景就像一幅畫在沙地上的圖案,風一吹就散了。用戶稍微改變視角,場景可能就出現嚴重的變形;用戶試圖移動一個物體,AI 可能無法判斷它與周圍物體的碰撞關係;用戶想要撤銷某個操作,AI 更是無從下手,因為它根本不知道剛才發生了什麼。這些問題在靜態展示中看不出來,但一旦進入實際應用——例如虛擬實境、遊戲開發、機器人模擬——就會立刻成為致命的缺陷。空間智能若要從實驗室走向實用,恐怕得先讓 AI 學會「記得自己改變了什麼」,而不只是「畫出一個像樣的世界」。
這意味著,未來的世界模型必須具備至少三層能力:第一層是感知,能夠理解三維空間中的物體與結構;第二層是推理,能夠預測物體之間的互動與物理規律;第三層是記憶,能夠記錄每一次操作的狀態變化,並在需要時進行回滾或修正。目前多數研究團隊的注意力集中在第一層與第二層,第三層的「狀態管理」往往被視為工程問題而忽略,但恰恰是這項能力,決定了生成世界能否從「展示品」升級為「工具」。值得注意的是,這並非純粹的理論探討。在機器人領域,空間智能的應用已經開始浮現。機器人需要在真實世界中導航、抓取物體、避開障礙,這些任務都依賴於對三維空間的即時理解與操作。
如果機器人內建的世界模型具備完整的狀態底账,它就能在執行任務的過程中不斷更新對環境的認知,並在出錯時回溯到先前的狀態,重新規劃行動路線。這對於提升機器人的自主性與可靠性,具有直接的幫助。在虛擬實境與遊戲產業,這項技術同樣具有廣闊的應用前景。目前的虛擬世界大多是預先建模的,場景中的物體行為由開發者手動編寫腳本控制,缺乏真正的動態生成能力。如果 AI 能夠即時生成一個具備完整狀態管理功能的三維世界,開發者就能大幅縮短場景建置的時間,玩家也能獲得更自由、更真實的互動體驗。
想像一個開放世界遊戲,玩家可以隨意破壞建築、搬運物品、改變地形,而遊戲引擎能夠即時追蹤所有變化,並在玩家離開後讓世界「記住」這些改變——這正是狀態底账所能帶來的體驗升級。當然,要實現這樣的願景,還有許多技術難題待解。三維空間的狀態表示本身就是一個開放問題,如何用緊湊的資料結構描述一個複雜場景中所有物體的動態屬性,目前還沒有標準答案。此外,狀態的更新需要與物理模擬、渲染引擎緊密配合,這對計算效率提出了極高的要求。李飛飛團隊近年來發表的數篇論文,已經在空間感知與三維理解方面取得了初步成果,但要真正建立起一套完整的「世界狀態管理系統」,仍需要跨領域的長期投入。
從更宏觀的角度來看,空間智能與狀態底账的結合,其實反映了 AI 發展的一個重要趨勢:從「生成內容」走向「生成世界」。前者關注的是輸出結果的逼真度,後者關注的是系統的可用性與一致性。這條路徑的終點,或許是一個能夠與人類長期互動、持續演化的虛擬環境——它不僅看起來真實,更在邏輯上站得住腳,經得起用戶一次又一次的測試與折騰。而這一切,都始於那本看似不起眼、卻至關重要的「底账」。
Related
相關文章

世界模型離通用還有多遠?
TechPulse2026.08.25 12:06 · 來自河北全文1711字00:00 / 05:05通用世界模型不是單一的生成器、模擬器、機器人動作模型或策略模型,也不是這些能力的割裂片段或簡單線性串聯,而是三種能力耦合在一起的閉環反饋系統。
具身大滿貫還全開源!原力靈機DM0.5登頂RoboDojo,且clone且珍惜
原力靈機的具身模型DM0.5在RoboDojo評測中奪冠,綜合得分24.90,平均成功率19.34%,並在記憶維度表現突出。該模型在LIBERO、RoboTwin 2.0等多項評測中皆取得佳績,且已全面開源。模型透過長記憶、具身思維鏈與對齊式動作監督等創新,並將核心延遲大幅降低至57.49毫秒,旨在以開源賦能產業生態。

WRC 2026|生數科技發佈最新研究成果,提出通用世界模型五級發展路線
WRC 2026 期間,生數科技發表最新研究成果,正式提出通用世界模型的五級發展路線。這項研究以階段化架構界定通用世界模型的能力演進,為該領域提供一套可供對照的技術框架。 生數科技此次發布的五級路線,將通用世界模型的發展劃分為依序推進的多個層級,每一層級對應不同的技術課題與能力範疇,共同構成完整的發展藍圖。透過明確的階段劃分,這項成果有助於外界更清楚地理解通用世界模型的發展脈絡,也具體反映出生數科技在該領域的持續投入。 相關成果已在 WRC 2026 期間對外公開,關於五級路線的具體內涵與後續研究規劃,仍有待生數科技進一步揭露。

高盛合夥人警告:華爾街普及 AI 或削弱金融從業者思考能力
作者:遠洋 責編:遠洋 評論: 8 月 25 日消息,高盛負責一項旗艦人工智能項目的合夥人警告稱,AI 在華爾街的快速普及可能削弱下一代金融從業者的思考能力。“這裡存在一個巨大的風險:在 AI 時代,我們把推理能力外包給這些模型,最終出現認知能力萎縮,以至於我們自己都無法再從第一性原理出發進行思考。
IJCAI 2026 覆盤局:中國人投了最多的稿,卻到不了最多的場
CCF降級沒能讓中國學者少投,但一紙簽證卻讓他們沒法到場。 作者丨幸麗娟 編輯丨岑 峰 德國不萊梅當地時間8月22日下午,IJCAI-ECAI 2026 迎來閉幕式。程序委員會主席 Diego Calvanese走上講臺,用一組詳實的數據為這場為期一週的學術盛會畫上句號。而站在這個節點上,IJCAI所呈現的不僅是論文與參會者的數字圖譜,也是一張值得 AI學術圈細讀的底稿。
IJCAI 2026 四項論文獎、三項個人成就獎,回答 AI 的「來路」與「去路」
AI 正在走的,是一條螺旋上升的路。作者丨幸麗娟 編輯丨岑 峰 8月20日,IJCAI-ECAI 2026 正會進入第三天。如果說18日的開幕式是榮譽的加冕,那麼今天,聚光燈從獲獎者轉向了獲獎研究本身。AIJ/JAIR 獲獎論文報告環節,獲獎論文作者依次登臺發表獲獎感言、回顧獲獎論文,詮釋這些經典研究在最新語境下的生命力和再思考。