AI 開始學習「想象未來」:ECCV 2026背後,中國學者如何卡位世界模型
世界模型開始合流,中國團隊正在進入核心問題。作者丨吳思夢 編輯丨岑 峰 2026 年 9 月 8 日,全球計算機視覺頂級會議 ACM 與 ECVA(European Computer Vision Association)主辦的 ECCV 2026 將在瑞典馬爾默的 Malmö Arena 和 Malmömässan 兩個相鄰場館開幕。這個兩年一屆、與 CVPR、ICCV 並稱計算機視覺領域“三大頂會”的學術盛會,收到了 10473 篇論文投稿,最終接收 2883 篇(接收率 27.5%)。
在會議公佈的 86 個 workshop 中,有 13 個直接以“World Models”或“Embodied AI”為主題,這是 ECCV 歷史上從未出現過的密度。Yann LeCun、Jürgen Schmidhuber、Kristen Grauman、Jamie Shotton 等學者都將作為 keynote 演講者出現。圍繞世界模型的 workshop、tutorial 和論文,從三維理解、視頻生成,到具身智能、安全評估,被集中放到了 ECCV 2026 的議程中。屆時AI 科技評論將前往現場,進行前沿追蹤報道。這背後代表的不只是一個研究方向升溫。
它意味著 AI 的競爭正在從“理解世界”,走向“預測世界”。而在這場變化中,中國研究者正在試圖佔據新的位置。01ECCV 2026 為什麼突然都在討論世界模型?世界模型並不是一個新概念。早在強化學習領域,研究者就提出過類似思想:如果智能體能夠預測環境變化,就可以減少真實世界中的試錯成本。但過去很長時間,這條路線沒有真正成為主流。原因很簡單:世界太複雜。真實環境中的數據昂貴,物理規律難以建模,而傳統模型很難同時處理視覺、動作和長期預測。過去兩年的變化,讓世界模型重新進入中心。一方面,生成式 AI 的快速發展,讓模型第一次具備了預測複雜視覺世界的能力。
另一方面,機器人和自動駕駛產業開始迫切需要一種新的學習方式。機器人不能像語言模型一樣,通過互聯網文本獲得經驗。它需要面對真實世界裡的動作和反饋。於是,一個新的問題出現:AI 能不能像人一樣,在行動之前先想象?ECCV 2026 的世界模型相關討論,實際上集中在四個問題。第一個問題:世界模型如何構建?研究者需要回答,什麼樣的數據才能訓練一個理解世界變化的模型。單純的視頻是否足夠?是否需要動作數據?是否需要三維信息?第二個問題:世界模型如何評價?過去評價生成模型,通常關注圖像質量。但世界模型不同。一個模型生成的視頻再逼真,如果無法幫助機器人完成任務,也沒有真正價值。
因此,新的評測體系開始關注:模型是否理解空間關係?是否符合物理規律?是否能夠預測行動結果?第三個問題:世界模型是否可靠?如果未來進入自動駕駛、人形機器人等領域,錯誤預測可能帶來真實風險。模型不僅需要預測未來,還需要知道自己的預測是否可信。第四個問題:世界模型如何進入行動閉環?這是最關鍵的一步。預測未來不是目的。幫助機器做出正確行動,才是世界模型最終價值。如果再把這四個問題放到一起看,會發現 ECCV 2026 上世界模型的爆發,並不是單一研究方向升溫,而是三股獨立趨勢在同一年合流的結果。第一股是世界模型本身的範式轉移。
從 Yann LeCun 2022 年的 JEPA 論文,到 ECCV 2026 主會 keynote 上 Yann LeCun 與 Jürgen Schmidhuber 同臺,世界模型從“少數派方向”變成了主流共識。LeCun 長期主張“智能的核心是預測物理世界”,而工業界的 Sora、Veo、Genie 把這條預言變成了可視化產物。當 CVPR、NeurIPS、ICLR 都把世界模型作為專題時,ECCV 的轉向只是時間問題。第二股是 3D 高斯潑濺(Gaussian Splatting)的工程化成熟。
2023 年 Inria 團隊在 SIGGRAPH 上重新激活這條路線後,三年內它已經擴散到 SLAM、水下場景、熱紅外、4D 動態場景、壓縮流式傳輸、醫學 CT 重建等幾乎所有 3D 視覺下游任務。ECCV 2026 第一場海報就列出超過 80 篇 Gaussian Splatting 相關論文,覆蓋範圍橫跨動態 4D、自動駕駛模擬、醫學影像。當世界模型需要“操作 3D 場景”時,3D 高斯是最自然的 token 候選,它可微、緊湊、有位置/朝向/尺度/顏色/透明度五個可學習參數。這讓“世界模型的可計算基座”第一次有了工程落點。第三股是具身智能的產業化壓力。
當人形機器人、自動駕駛汽車、配送機器人開始面對真實的開放環境,單純模仿學習的泛化瓶頸就暴露了。Spirit AI、Physical Intelligence、Google DeepMind、NVIDIA 同時押注 VLA + 世界模型,不是技術潮流,而是工業交付壓力下的工程妥協。這三條線在 ECCV 2026 第一次正式會師:13 個 Embodied AI & World Models workshop、3 個 keynote、Yilun Du 等 panelist 的“AI 能否自主發現新知識”圓桌討論,背後是同一個判斷:世界模型、3D 表示、具身智能已經不再能分開討論。
02中國學者正在補齊世界模型的三塊拼圖模型需要的不只是更大的參數量,還需要連接三個環節:理解世界,預測未來,影響行動。在這條產業鏈上,中國研究者正在從不同方向切入。有人試圖重新定義世界模型的邊界,有人在建立評價體系,也有人正在把模型推向真實機器人。▎王新超:重新定義世界模型,從“生成未來”到“行動未來”世界模型最大的爭議之一,是它到底應該做什麼。如果一個模型可以生成未來的視頻,它是不是已經理解世界?答案並不確定。因為現實世界中的智能,並不只是預測。預測的目的,最終還是落到行動。王新超(新加坡國立大學)團隊提出的 World Action Model(WAM)概念,正是在重新劃定世界模型的邊界。
在《World Action Models: A Survey》中,研究者認為,過去很多工作混淆了世界模型、視頻生成模型、視覺語言行動模型之間的區別。真正面向具身智能的世界模型,需要滿足一個條件:預測出來的未來,必須進入行動路徑。簡單來說:如果模型只是生成“未來會發生什麼”,它更像一個視頻預測器。如果模型利用這個預測幫助機器人決定“下一步應該做什麼”,它才更接近世界模型真正的價值。這也是 WAM 這個概念出現的原因。過去的 VLA(Vision-Language-Action)模型解決的是:看到什麼,應該做什麼。而 World Action Model 希望進一步解決:如果這樣做,未來會怎樣。
這種變化非常關鍵。因為現實世界中的任務,往往沒有標準答案。機器人拿起一個杯子,不只是識別杯子在哪裡,還需要判斷:杯子的重量是多少?抓取力度是否合適?移動過程中是否可能碰撞?這些問題,本質上都需要預測。因此,未來的具身智能系統可能不是一個單純的行動模型,而是一個“預測未來,再選擇行動”的系統。▎陳志波、李新:讓世界模型從“看起來真實”走向“真正可用”世界模型發展的另一個難題,是如何判斷一個模型到底懂不懂世界。一輛生成出來的汽車視頻,即使視覺上非常真實,如果下一秒車輛運動違反物理規律,它仍然無法用於自動駕駛。因此,世界模型需要新的評價標準。陳志波團隊關注的,正是這一問題。
他們提出的 4DWorldBench,將評價對象從單純視覺質量擴展到更接近真實世界的問題:模型是否理解空間結構?是否保持時間連續性?是否符合物理規律?是否能夠支持後續任務?這也是為什麼 benchmark 正成為世界模型競爭的重要部分。因為沒有評價體系,就無法知道一個世界模型到底是在理解世界,還是隻是在模仿世界。在這一方向上,陳志波團隊和李新(Xin Li)團隊進一步探索了世界模型與 VLA 的結合。ECCV 2026 主會場出現的 VLA-JEPA,就是其中一個代表。它嘗試在視覺語言行動模型中加入潛空間世界模型,讓模型不僅學習當前觀察和動作之間的關係,也學習隱藏狀態如何變化。
簡單理解:傳統 VLA 更像是看到圖片後直接回答:“下一步怎麼做?”而加入世界模型後,模型會多一個過程:“如果我這樣做,未來狀態可能是什麼?”再決定動作。這讓機器人從即時反應,向預測式決策邁進一步。▎楊高、梁曉丹:讓世界模型進入機器人如果說前兩條路線解決的是“世界模型是什麼”和“如何評價”,那麼楊高和梁曉丹關注的問題更加工程化:世界模型如何真正進入機器人。
9 月 9 日的 ECCV 2026 “How to Build Effective World Models for Embodied AI” workshop 中,二者出現在該 workshop 早期公佈的 invited speakers 名單中。最終議程裡,梁曉丹成為重要演講嘉賓。他們代表了兩條不同的路線。楊高更關注如何利用大規模視覺數據和基礎模型能力,讓機器人獲得更強泛化能力。梁曉丹(中山大學)是另一條路線。她的核心命題是物理具身基礎模型:表徵、架構及真機評測,強調世界模型的核心價值是預測一個會發生的世界,而不是生成一個像真的視頻。
這條命題在 ECCV 2026 之前,已經通過幾個工作落地:A1(自適應早退機制)、AtomicVLA(原子動作分解)、eWAM(VLA 與世界模型的原生融合)、PhyAgentOS(標準化框架)、ManipArena(真機評測基準)。eWAM 的核心思想是把世界模型的潛空間預測作為 VLA 的內部監督信號,讓預測下一幀與輸出下一動作共享表示,這與 VLA-JEPA 的判斷一致,但路徑不同:VLA-JEPA 強調潛空間作為接口,eWAM 強調原生耦合。
ProPhy 是這個思路在視頻生成側的延伸:通過 Mixture-of-Physics-Experts(MoPE)機制,把物理先驗逐層注入視頻生成,讓視頻是否符合物理規律成為可優化目標。兩條路線的合流點是:當 VLA、世界模型、視頻生成都在嘗試把物理一致性內化為可優化的目標時,世界模型這個詞的邊界正在被改寫,它不再只是預測未來的模塊,而是機器人感知、決策、生成三者的共同約束。這也是為什麼 ECCV 2026 把它放到與 Embodied AI 同等的位置。03最後世界模型競爭的下一步,已經從“能不能生成好看的未來”,轉向“能不能預測一個會發生的世界”。
圍繞這個問題的不同回答,構成了 ECCV 2026 世界模型相關 13 個 workshop、上百篇論文和同期競賽的全部議程。當學界、產業界、監管者把視線投向同一議題時,它就不再只是一個研究方向,更是一個產業拐點。中國研究者從世界模型的邊界、評價體系、機器人落地三個方向切入,並不是分散行動,而是同一個問題的三個不同側面。當這三個側面在某個時間點拼合在一起時,中國學術界在世界模型這條賽道上的位置,才會被真正改寫。為了方便大家抱團交流、互通會議消息,專門建了 ECCV 2026 參會交流群!進群你會解鎖這些「福利」?
會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?
進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。