Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026

2026年9月23日 09:50
Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026
站內 AI 整理稿

本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻!只靠語言和 token,AI 永遠跨不過物理世界這道門檻!作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。但這條路線撞上了天花板:預訓練的邊際收益肉眼可見地遞減;模型一旦部署到真實世界,漏洞百出。2026 年,“世界模型”接棒 Scaling Law,成了牌桌上最擁擠的籌碼。

然而,這個詞本身,同時被四條技術路線認領,而它們對“理解世界”這件事,幾乎各說各話。第一條賭湧現:Sora、Genie 這類視頻生成路線相信,只要下一幀逼得夠真,物理規律就會自己從像素里長出來。第二條賭幾何:李飛飛聯合創立的 World Labs,從底層表徵就鎖死三維一致性,直接生成可自由探索的虛擬世界。第三條賭仿真:英偉達 Cosmos、Omniverse,把顯式物理引擎當作機器人的練兵場。第四條路最孤峭,也最反常識:2018 年圖靈獎得主、深度學習三位“教父”之一 Yann LeCun,押注 JEPA(聯合嵌入預測架構),它不生成未來,只在抽象表徵的空間裡預測未來。

四條路的根本分歧,本質上在於一個問題:機器要“懂”物理世界,究竟該去復刻它,還是去推理它?前三條都在不同程度上試圖讓機器“看見並重建”世界;JEPA 卻選擇另一條路——編碼器先丟掉那些根本不可預測的細節,只保留可預測、可規劃的結構,然後在抽象表徵空間裡預測未來。在 LeCun 眼裡,連“預測像素”這件事本身都是偽命題:你把攝像頭對準房間一角開始錄像,下一幀會拍到什麼,取決於鏡頭外有沒有人走進來、光線會不會變化。而這些信息,在“當前幀”里根本不存在。

在 ECCV 2026 Keynote 演講《World Models: Enabling the next AI revolution》中,LeCun 給出的,是一個比“Scaling Law 還能撐多久”更根本的判斷:只靠語言和 token 訓練,AI 到不了人類水平智能,也跨不過物理世界這道門檻。在 LeCun 看來,如果我們要通往真正的通用人工智能(AGI),就必須打破對“生成式”的崇拜。真正的下一章,是讓 AI 系統從視頻、傳感器與交互中,學習並構建世界模型;再用 JEPA 去理解世界,去預測行動後果,去規劃出實現目標的動作序列。

在Keynote的最後,LeCun給出了三個與眾不同、甚至堪稱“暴論”的建議:1.別再死磕生成式模型了。2.別再去研究 LLM 了。3.轉向聯合嵌入,轉向抽象表徵,轉向世界模型。可以說,這次演講,本質上是對“智能是什麼、AI 該往哪走”的一次路線重估。而臺下的聽眾,比誰都更該聽懂這句話。作為計算機視覺的研究者,他們最清楚:真實世界遠比語言更髒、更連續、更高維。LeCun 要講的,正是如何讓 AI 真正“看懂”並“應對”它。以下是 Yann LeCun 在 ECCV 2026 大會發表的 Keynote 演講,AI 科技評論基於原英文演講內容進行了不改變原意的編輯。

01我們離 AGI ,還差得遠感謝大家的到來。確實如主持人所說,我是一位天文攝影愛好者,一有時間就會拍攝星空,我的演講封面就是我的 51 和 42號作品。但我今天不是來講天文的,我是來聊世界模型的。我想開門見山地說一句:我們遠沒有走到 AI 的終點,甚至遠沒有走到計算機視覺的終點——否則你們也不會坐在這裡。我們遠遠沒有搞定 AI。如果你去聽硅谷裡最樂觀、也最悲觀的那批人的說法,好像“我們已經實現 AGI 了”,但不管他們嘴裡的 AGI 到底是什麼,我今天的演講,就是要告訴你們:並非如此。一句話總結我的態度:當下的人工智能,還差得遠(AI sucks)。

當我們把 AI 系統的能力、尤其是它的學習效率,跟動物和人類的學習能力放在一起比,差距大到根本不在一個量級。AI 確實能寫代碼、做數學、通過律師考試、贏得數學奧林匹克。但一個能在家裡幹活的通用機器人樣板,到底長什麼樣?一輛真正的 L5 級全自動駕駛汽車,又在哪裡?在理解物理世界這件事上,AI 系統比起生物界,仍然落後得不是一星半點。這一點不用我多解釋,你們都是計算機視覺的研究者,最清楚真實世界有多“髒”,它比語言要混亂得多。這就引出一連串尖銳的問題:為什麼今天人們口中的“AI”,也就是那些大語言模型聊天機器人,處理不了圖像、視頻、傳感器讀數這類高維、連續、充滿噪聲的數據?

為什麼今天一談到“智能體系統”,訓練它們的唯一辦法還是靠海量數據做模仿學習?然而,這種訓練方法需要的數據量驚人,而且只對能收集得到數據的那個特定任務有效。對比而言,動物和人類學習新任務,根本不需要那麼多數據:我們面對全新情況時,可以零樣本(0-shot)、動用腦子去“吃透”這個問題,而不必事先受訓、專門練習怎麼解決它。這種能力從何而來?也許來自我們常說的常識。AI 系統確實有一種非常基礎的常識,但和我們在人類乃至普通動物身上看到的那種常識,完全不是一回事。一隻普通的家貓,能做出出乎意料的動作。比如藉著牆和傢俱的反彈力,跳到很高的櫃子頂上,非常聰明。

我們現在能造出擁有這種身體能力的機器人,卻沒法讓它們“聰明”到足以自主完成這些事。一個十歲的孩子,即便第一次被人要求收拾餐桌、用洗碗機,幾乎不用怎麼學就能無師自通。可我們至今還造不出這樣的 AI。再舉一個更硬核的例子:一個 17 歲的少年,大概用 20 個小時的實際練習就能學會開車,並且在練習時基本不會撞車;而我們手裡其實有來自行車記錄儀、各類傳感器的數十億小時數據,以及人類專家司機對應的操作指令。我們想用模仿學習和端到端方法,讓 AI 學會自己開車。結果呢?我們至今造不出 L5 水平的自動駕駛汽車。

那些接近 L4 水平的車,靠的並不是海量數據的模仿學習,而是內置了大量工程化設計,比如顯式建好的世界模型。當然也有人在推端到端學習,比如 Wayve 那幾家公司,但我們還沒到那一步。這就讓我們一再撞上一個悖論——莫拉維克悖論(Moravec's Paradox,1988),說的是:計算機能算複雜的積分、找路徑、下棋,可連動物都能做的簡單事,它卻搞不定。這逼著我們去追問:智能到底是什麼?我很喜歡一句常被安在約翰·凱奇名下的話——其實不是他本人說的,而是他的追隨者把他的思想濃縮成的一句話:“智能不是你知道什麼,而是當你遇到一個沒見過的新處境時,你做了什麼。

”換句話說,就是:面對一個任務,你用頭腦把它解決了,這才是智能。如果你是預先訓練好才完成它的,那你只是在套用配方,那不是智能,只是陳述性知識和技能的堆積。今天社區裡、乃至整個社會,常把“陳述性知識和單項技能的堆積”誤當成智能。真正的智能,是面對新問題時發明新技能、解決新問題的能力——這既定義了人類行為,也定義了非人類動物的行為。所以,衡量智能應該看兩件事:第一,學一個新任務有多快。需要試多少次才能成功,甚至可能一次都不用試,直接就會,這就是零樣本學習;第二,能快速學會的任務範圍有多廣。人類的特徵,正是適應力極強、學得快,能迅速應對新處境。

02智能的本質:人類自身都不“通用”,AI 也不該追求“通用”那麼人類和動物到底是怎麼學的?學習的基礎是什麼?發展心理學家曾把嬰兒的發育過程整理成圖表,標出他們在出生後第幾個月,開始掌握關於物理世界的基本概念。語言能力和社會交往能力,也有類似的發育時間表。比如面孔追蹤,幾乎從零個月就開始了——嬰兒會被運動和麵孔吸引,幾分鐘內就能識別臉;又比如他們學會區分“有生命”和“無生命”物體,發生在頭三到四個月;意識到客體恆存(東西被擋住也依然存在),也發生在早期幾個月。隨後,他們會開始擁有“穩定性”、“支撐”等概念。

但“每個不受支撐的物體都會下落”這種重力概念,則要花更長的時間(大約九個月),他們才能理解;而慣性,也就是我們說的直覺物理,他們需要學得更久。這些是怎麼學會的?很大一部分靠觀察。有些研究運動控制的心理學家堅稱,嬰兒無時無刻不在“互動”。但話說回來,三個月大之前的嬰兒幾乎沒法影響世界:他們只會比劃,很難抓東西。那麼,前面三個月裡發生的,到底是什麼類型的學習?我和社區裡一位同行合寫過一篇論文,核心論點是:世界是混亂的,所以,如果“智能”指的是快速學會新任務的能力,那麼“通用智能”這個概念根本不成立。我們人類,自身都沒有辦法做到“通用”。

人類智能極度專門化——在所有可被數學枚舉的問題裡,人類能解的只是極小一部分;就說日常的視覺任務,在所有可能的視覺任務中,人類也只能做極小的一部分。而且,我們每個人的技能組合都不同,這意味著我們在各自領域都是“專才”。就算從人類內部來看,我們也不是通用的。我能學著吹薩克斯、彈電鋼琴,但無法成為 McCoy Tyner 那樣的爵士鋼琴大師。每個人都能學一些東西,但沒人能樣樣精通。所以我們必須接受:AI 的本質不是什麼都懂,而是能快速學習、快速適應新任務。當然,我是做機器學習的,這麼說可能顯得有點“職業病”,但事實就是如此。對應的問題便是:AI 靠什麼原理學習,又需要什麼數據?

這話對你們來說其實不新鮮——你們都是做計算機視覺的,本來就明白:光靠文本訓練,不管模型在數學和編程上考多高的分,都不可能達到人類水平智能。我把這筆賬算得更具體一點。先看大語言模型的預訓練數據。一個典型的大語言模型,如果把互聯網上所有公開文本都拿來訓練,大約是 20 萬億個詞,換算成 token 大約是 30 萬億個。每個 token 大約佔兩到三個字節,乘下來,總量大約是 10¹⁴ 字節。這個數字是什麼概念?如果讓一個人把這些文本全部讀完,大約要花 40 萬年。再看一個人類小孩。

我們的視網膜分辨率很高,大約有六千萬到一億個感光細胞,但信號在傳給大腦之前會被壓縮:每隻眼睛大約通過 100 萬根視神經纖維輸出,兩隻眼睛加起來約 200 萬根。每根纖維大約每秒傳輸 1 字節。一個四歲孩子,在生命頭四年裡累計清醒的時間大約是 6 萬小時。把這兩個數乘起來:200 萬根纖維 × 每秒 1 字節 × 6 萬小時,得到的信息量大約也是 10¹⁴ 字節。也就是說,一個四歲孩子通過視覺和觸覺,所接收到的數據量,已經和互聯網上所有公開文本的總量相當。所以,AI 只靠文本訓練,信息量遠遠不夠,更別說達到人類水平智能。“我們需要視覺”這件事,對你們、對我,都是好消息。

03從 token 預測到世界模型:System 2 缺位與十年佈道接著來看第二個問題:智能系統裡應該發生什麼樣的“推斷”?我們能不能造一個系統,讓輸入數據向前穿過一堆神經網絡層,最後只輸出一個 token(比如一個離散的詞),就當作完成了推斷呢?神經網絡正是這麼做的:給它喂一段文本,它讓文本向前穿過巨大的神經網絡,然後輸出下一個 token。但這不是智能行為,它本質上只是被動反應;在生成一個 token 的那一瞬間,網絡內部沒有任何推理或思考。大語言模型做了兩件事來彌補這一點。第一,它生成比必要多得多的 token,這叫思維鏈(Chain of Thought)。

通過產生大量 token,它增加了得出答案時的計算量。但如果你只讓它回答“是”或“否”,它內部根本沒有可以展開的思考機制。第二,它生成很多不同的 token 序列,再用某種方式挑出其中最好的。只要生成的輸出能被驗證對錯,這招就極其高效。所以它適用於代碼和數學:你生成一個證明,可以逐步驗證;生成一個程序,可以跑起來看結果。於是系統能評估自己的輸出,再迭代改進自己——這正是大語言模型在數學上那麼強的原因。但只要一碰到真實世界,驗證就變得極慢,幾乎不可壓縮。機器人領域裡,可以用模擬器應用某些情況,比如讓機器人走路、跑步,這些簡單動作還行得通,但操縱物體就不行了。那怎麼優化?

我的解法是:更強大的推斷模式。不應該只是讓網絡前饋計算、直接吐出答案,而應該是:答案不再由網絡直接生成,而是被當作輸入送進網絡,讓網絡給它打分。具體說:網絡會算出一個標量,衡量“當前這個候選答案,對觀察到的輸入來說有多好”。這個分數叫能量(Energy)。這個能量函數的輸出越小,說明答案越好。然後,系統在外部通過搜索和優化,不斷嘗試不同的候選答案,讓網絡給它們打分,最後找出能量最低的那個——也就是最好的答案。這在概率推斷裡是經典套路。傳統的推斷從來都包含某種搜索與優化:不是一步給出答案,而是反覆提出候選、評估、再改進。它天生就比“貪婪地吐一串離散 token”更強大。

而這,就引出了“世界模型”這個概念。因為,如果系統要搜索出一個對應輸入的“好輸出”,而這個輸出是一個動作,比如機器人的一個動作,或者一串動作序列,那麼它就必須能夠預測自己動作的後果。這就是世界模型。世界模型,簡單而言就是一個訓練好的系統:給定 t 時刻的世界狀態,再給定一個你想象中智能體要採取的動作,它就能預測採取這個動作後世界會變成什麼樣。接著,你把預測結果餵給一個目標函數,也就是代價函數。它輸出一個標量,衡量任務完成得怎麼樣:任務完成了就是 0,越沒完成數值越大。系統要做的,就是通過優化,搜索出一串能最小化這個代價的動作。這比大語言模型那種貪心地逐個生成 token 的方式,要強大得多。

從心理學的角度看,這種“用你心裡的世界模型去想象動作的後果,從而規劃出達成目標的動作序列”的過程,正是人類所說的 System 2,也就是你面對新處境、需要動用全部腦力時的決策與行動方式。相比之下,System 1 是更被動的反應式行動:你清楚該做什麼,不需要想。今天的機器人大多屬於 System 1;只有那些帶運動規劃、能預測後果的機器人,才更接近 System 2。這套思路,我已經倡導了大約十年。2016 年,我在 NIPS(後來更名為 NeurIPS)做主旨演講時就說過:AI 的未來是世界模型,那才是我們該攻克的下一個前沿。

後來我又花了幾年,才把這些想法整理成一篇完整的論文,題為《A Path Towards Autonomous Machine Intelligence》(通往自主機器智能之路)。那篇論文是四年前發佈的,感興趣可以去讀。我在 YouTube 上也做過幾次演講。此後,我們朝這個方向,又走了很遠的一段路。大約一個月前,我創立了一家公司,名叫Advanced Machine Intelligence(AMI Labs),就是為了真正加速這個方向的進展。04世界模型的建構:安全護欄與層級化規劃世界模型會預測動作的後果,並搜索能優化目標的動作。

這裡除了主要目標,通常還需要設置其他目標函數,這些設置可以視作“護欄”(Guardrails)。這正是所有關注 AI 安全的人會感到欣慰的地方:你可以通過施加這些護欄,把安全硬編碼(Hardwire)直接寫進系統。為什麼?因為這個架構從設計上,讓模型只能完成你給定的任務,而且必須在優化過程中滿足“護欄”目標,讓它根本沒有“越獄”的入口。它不像大模型那樣從根本上不可控,只能靠各種“花招”勉強保證安全。那些大模型既不怎麼聰明,也沒多危險,但它們確實不可控。而我們這個架構,只要你能把世界模型設計得大致正確,把“護欄”目標設計得能保障安全,它在構造上就是安全的。

當然,它也有難以滿足的前提條件,但它是一個可以靠工程努力逐步解決的難題。有了世界模型,你當然可以拿它做迴歸式預測:給定(可能很短的)動作或動作序列,它預測未來;你反覆這麼做,讓系統向前預測多步,再做優化、找到好計劃、執行第一步、然後重新規劃。這叫模型預測控制(Model Predictive Control),在最優控制裡是上世紀五六十年代就有的老工具,一點都不新。新的地方只在於:我們這次是拿世界模型來跑它。但我們最終想創建的(現在還做不到,屬於未來工作),是層級化規劃(Hierarchical Planning)。人和動物在規劃複雜動作序列時,並不是在“基本動作”層面規劃的。

對人類來說,基本動作是每 10 到 20 毫秒一次的肌肉控制。我們是在高得多的抽象層級上規劃,再一層層往下細化成低級動作。舉個例子:我現在在紐約的辦公室,明天想去巴黎。我不可能用“毫秒對毫秒的肌肉控制”來規劃整段旅程。一來太長了,二來我根本沒有足夠信息做這種規劃——我不知道街上會是什麼樣,也不知道要不要等出租車。所以我做的是高層計劃:去機場,趕飛機。這個計劃很抽象,它給我的子目標是“我到機場了嗎”,於是代價函數就變成“我離機場還有多遠”。下了樓、上了街、打到車之後,怎麼開出這條街?那是更下層的子問題。在辦公室裡,我得去電梯、按按鈕、走出大樓,那怎麼從椅子上站起來、走到電梯?

每一層都需要某種規劃。但到了最底層,你掌握了一切所需信息,反而不用再規劃了:從椅子上站起來這種事,你做過太多次,想都不用想。所以,接下來幾年 AI 的關鍵挑戰,尤其是在理解和控制真實世界方面,在於層級化規劃。而這,需要層級化的世界模型。05JEPA:不預測像素,在表徵空間預測世界那怎麼建世界模型?考慮到生成式 AI 現在這麼火,最本能的思路就是採用生成式架構。舉個例子:我有一段視頻,把後半段遮住,只把前半段輸入系統,訓練一個大網絡去預測視頻後面會發生什麼。這跟訓練語言模型預測“下一個詞”是同一個道理。

可這個思路我試了快二十年,前十五年基本都在失敗,因為我一直執著於用生成式模型、在像素層面做預測。很多人確實在做像素級的視頻預測,用來做視頻生成。這很酷,也挺好。但如果你想理解世界的底層本質,我認為這個方法很糟糕:模型根本就不該去預測像素。更讓我感覺不舒服的是,現在有人直接把“視頻生成模型”叫做“世界模型”,我完全不認同。為什麼不預測像素?因為“預測像素”這個任務根本不可能——不是難,是不可能。舉個例子:我把攝像頭對準房間一角開始錄像,然後讓系統預測接下來視頻裡會發生什麼。可攝像頭會一直轉,你根本無從預測下一幀長什麼樣,因為要預測下一幀,所需的信息根本不在當前輸入裡。

你可能會說:那預測下一個詞不也不可能嗎?在文本里,我們可以表示“所有可能 token 上的概率分佈”,token 數量雖大,卻是有限的。可圖像呢?我們不知道如何有效地表示“所有可能圖像上的概率分佈”。如果你硬要做點預測,系統只會給出所有未來平均值的模糊結果,這就是為什麼很多視頻預測論文裡,預測出來的畫面總是糊的、模糊的。加 VAE、隱變量,確實能緩解這個問題,但也只是用來幫助視頻生成得更好,模型依舊不理解世界的底層本質,因為它憑空“想象”出一個不存在的未來,預測幾乎必然是錯的。

我提出的解法,就叫做 JEPA(Joint Embedding Predictive Architecture,聯合嵌入預測架構)。架構如右邊所示:它和生成式架構很像。你觀察到 X,可能還有動作,要去預測 Y,比如視頻後半段。但在 JEPA 裡,你把 X 和 Y 都送進編碼器,於是預測發生在編碼器輸出的表徵空間裡,而不是在像素空間裡。編碼器的作用,就是丟掉輸入中那些根本不可預測的信息。舉例來說:一輛車在街上開。如果你用像素級預測去訓練自動駕駛系統,它就得精確預測樹上葉子被風吹動的軌跡、樹後水塘的漣漪、以及剛從車後冒出來的行人衣服的褶皺——這太荒唐了。

現實是:模型不僅不需要,也不想去預測這些東西;並且,如果硬要系統去解這種本質上無解的問題,反而會損害它。因此,應當放棄生成式建模,轉而訓練一個只在表徵層面進行預測的系統。在該表徵空間中,不可預測的信息已基本被剔除。你可以把它想成噪聲消除,想成一種對“你不在乎、也預測不了的細節”保持不變性(invariant)的表徵。這會讓預測問題容易得多,不過,也帶來了另一個問題:坍塌(collapse)。如果我只靠最小化預測誤差去訓練 JEPA,編碼器大可以乾脆忽略輸入,輸出一堆常量表徵。這樣一來,預測任務立刻變得毫無難度,但也對我們毫無用處。這就是表徵坍塌。

生成式方法沒有這個問題,因為它被強迫去重建像素,很多人因此偏愛生成式模型。06表徵坍塌的解法:從科學抽象到 SIGReg不過,我們有防止坍塌的辦法,而且思路很多樣。關於如何用聯合嵌入架構防止坍塌的問題,我 1993 年就有篇關於孿生網絡(Siamese networks)的論文;而更早的聯合嵌入類架構,Hinton 等人在 80 年代末、90 年代初也都提過。雖然那時的防坍塌方法不夠完美,但這個思路本身早就有了,並不是新概念。我想為 JEPA 辯護一句:模型學習抽象表徵來做預測,不是憑空另起爐灶,而是沿用了科學一直在用的方法。

科學的核心就是先觀察現象,找出其中真正相關的變量,然後建立一個能夠預測我們所觀察現象的模型。JEPA 只是把這種科學方法搬到了機器學習裡。原則上,我們當然可以用粒子物理或量子場論來預測這個房間裡發生的一切。但那完全不實用:你得模擬房間裡的每一個粒子,還得知道方圓幾立方公里內的波函數。而且,模擬會瞬間因混沌而發散,根本不可行。所以,如果我給你一箱空氣,告訴你我要把它加熱 10 開爾文,你靠理想氣體定律(PV=NRT)就能知道壓強會漲多少——你完全不需要知道每個分子的位置和速度。因此,預測的關鍵,在於識別出相關變量,並忽略掉那些我們視為噪聲或熵的東西。

從場論到粒子、原子、分子,再到生物界的蛋白質、細胞、機體、個體、社會、生態系統——這個層級中的每一層,都忽略掉下一層的某些細節,卻仍然能夠對更大的系統做出更長期的預測。所以,描述此刻這個房間最貼切的方式,應該是心理學和社會學,而不是神經科學、生物學或場論。你無法把生物學還原成化學,再把化學還原成物理——你可以這麼做,但沒有用。化學層面有很多概念,底層物理並沒有捕捉到。每一層,其實都對應一門獨立的科學;而一門科學,恰恰是由“你在觀察系統狀態時,究竟操控關於狀態的哪部分信息”來定義的。愛因斯坦有句話我很喜歡:“關於世界,最可理解的事情是:世界是可理解的。

”而這很可能正是因為,我們能夠建立起那些層級化的表徵。JEPA 就是要替我們做這件事。它不是世界模擬器,不是數字孿生,不是生成模型,更不是視頻生成。它只做一件事:找到一個能夠支撐預測的抽象表徵。只要能訓練出這種東西,我們就能把它用在任何“現象很複雜、卻很難用還原式動力學方程去建模”的場景,比如渦輪機,一個就有上千個傳感器;比如化工廠、電廠、病人。如果有個預測模型能告訴我:“給定病人現在的狀態,以及一項治療干預,t+1 時刻他會是什麼狀態”,那就太好了。這個想法,其實早在上世紀 50 年代的蘇聯、60 年代初的西方就有了。那具體怎麼訓練?前面說過,要防坍塌。

坍塌的根源,是編碼器不從輸入裡提取相關信息,乾脆忽略輸入。所以我們想要一個信息量的度量 I(sx)。做機器學習要最小化代價,於是代價取 −I(sx),也就是最大化編碼器輸出的信息量。同時,系統又要最小化預測誤差。於是它必須在兩者之間找權衡:儘可能多地從輸入中提取信息,但只提取可預測的信息。一句話,這就是 JEPA。麻煩在於:怎麼度量信息?要最大化一個量,通常需要它的下界。但信息量的尷尬在於,我們只能近似估計它,而且目前只能得到上界。你可能會說,用互信息來解決。但要算互信息,你必須知道真實的數據分佈 P,也就是數據在真實世界裡到底是怎麼產生的、每個可能取值出現的概率有多大。

而這個 P 你根本不知道。你只能通過一堆樣本去猜測它、近似它。在高維空間裡,比如像素,甚至高維表徵,你根本估不出 P(x),也就無法量出信息量。唯一能度量信息的辦法,是對 P 做一些假設;而這些假設都會忽略變量之間的某些依賴,於是模型的估計永遠是下偏的。我們只能接受這個現實。具體做法是:取一個 batch 過編碼器,得到表徵向量矩陣。每一行是一個樣本,每一列是一個變量。防止坍塌的方法大致分兩類:第一類是樣本對比:把矩陣的每一行彼此推遠、互相排斥,讓矩陣變得“有信息”。但這種方法存在侷限,它會產生 N² 個排斥項,因此需要非常大的 batch,而且學不出能填滿高維空間的表徵,問題不少。

第二類是維度對比:讓矩陣的每一列互不相同,這同樣能讓矩陣有信息、避免坍塌。具體做法是,將向量映射到更高維的空間,再讓這些列互不相同。根據約束方式的不同,又可以分為幾類:讓變量不相關(VICReg),這個方法是我和 Adrien Bardes、Jean Ponce 在幾年前發表的。讓變量呈獨立高斯分佈(SIGReg),這是 VICReg 的後續工作。讓變量分類且不同(DINO),很多人聽過 DINOv2,你可以把它某種程度上看作維度對比或聚類式的方法,效果很好。我偏好維度對比法,因為它更高效、更穩定,不需要超大 batch。接下來,我會重點講一下 SIGReg 的做法。

SIGReg 的做法可以分幾步來理解。首先,取編碼器輸出的表徵矩陣:每一行是一個樣本,每一列是一個變量。SIGReg 在這個矩陣的行方向做擴展——用簡單的線性投影增加更多列,也就是把每個樣本向量投影到一個更高維的空間。然後,它提出一個要求:在這個高維空間裡,沿著 batch 看,每一個投影變量(也就是新增加的每一列,它們都是原向量的線性投影)的分佈,都應該是零均值、單位方差的高斯分佈。為什麼要這樣做?因為數據本來可能躺在一個高維流形上。編碼器的任務,就是把這個流形“展開”,用有意義的表徵來表示它。而 SIGReg 想做的,是用高斯分佈去表示這個流形。具體怎麼實現?

把樣本沿著若干個方向投影,每個方向都會得到一個邊際分佈。對每個方向,讓這個邊際分佈儘量接近高斯。這很好算:我們可以計算經驗累積分佈函數(CDF),再和理論高斯的 CDF 進行比較。比較之後,對每個樣本,我們都能知道該往哪個方向移動,才能讓經驗 CDF 更像高斯 CDF。我們還有一些更花哨的做法,比如在四維空間裡操作,但核心思想是一樣的。這裡有一個理論保證:當所有這些邊際分佈都變成高斯時,原空間中的聯合分佈就會趨於獨立高斯——而這正是我們想要的、信息量最大的狀態。所以這個思路巧妙的地方在於:從一個任意(可能很扭曲)的分佈出發,套用這個準則、挪動點或改網絡參數,就能逼近高斯分佈。

07JEPA 的實證與應用:從 LeWorldModel 到 V-JEPA我們可以用這個思想來建世界模型。我們有一篇比較新的論文,叫LeWorldModel,就是沿著這個思路做的,可以用來解決簡單的規劃問題;我們還在試著把它 scale up。這個方法得到了一個結論是:如果底層真實數據是聯合高斯的,而你的相機或傳感器觀測只是它的高度複雜變換,那麼用 SIGReg 條件訓練出的編碼器,就能恢復出底層的那個高斯。當然,世界不是高斯,底層流形也不是,所以這不是完備解、不是萬靈藥,但效果已經相當不錯。除了 LeWorldModel,把 JEPA 思想用到各種問題上,如今也是論文井噴。

你在 Google Scholar 搜“Joint Embedding Predictive Architecture”,這個詞是我幾年前起的,大概能搜到約 28 篇。其中很多用了我們預訓練出的模型,比如 I-JEPA:它是一種很棒的學圖像表徵的方法,學視頻表徵甚至更好。以色列一家研究所有一篇新論文(他們客氣地把我列名,但我零貢獻),就用 JEPA 預訓練圖像表徵去做 DXA 圖像(雙能 X 線吸收法,一種特定類型的 X 光)表示,然後在上面接一個監督頭,去預測一堆和密度無關的東西,效果出奇地好,這種做法很簡答,但確實挺讓人意外。

DINOv3 你們很多人聽過,可以算 JEPA 的一種(當然裡面加了不少讓它跑得動的 trick)。而過去這一年半越來越清楚的是:自監督學習最終產出的圖像表徵,比監督學習、甚至比 CLIP 那種弱監督都更好。現在多數能理解圖像的模型靠 CLIP 訓練出好用的語義特徵,但一旦到了深度估計、分割這類底層任務,自監督的效果,會更強。我們在生物和醫學(X 光等)上也有不少應用,並且也訓練了更多模型(用這類分佈方法,或信息最大化方法),確實有效。幾年前,我聯合指導的學生髮表的一篇論文,用 JEPA 訓練了一個預測器,從左邊看到的配置出發,給它頂部的目標,規劃出一串動作到達類似目標的狀態。

這種方法在簡單模擬規劃裡相當好用。再說到視頻 JEPA:V-JEPA 2,以及我們創立 AMI 之前剛剛發佈的 V-JEPA 2.1(這項工作的整個團隊基本都加入了 AMI)。它的訓練方式靠“破壞”:取一段視頻,遮住其中一大塊連續的時空區域(即一個“時空管”),然後訓練系統從部分被遮掩視頻的表徵,重建完整視頻的表徵。它的效果非常出色,而且還學到了一點常識:用訓練好的系統預測未來幀時,如果輸入一個“不可能”的事件,比如有人扔球,球卻停住、消失或變成方塊,時序預測誤差會急劇上升,因為系統已經知道“這不可能發生”。

這是一種“意外度”(Surprise)的度量,與兒童心理學家用來判斷嬰兒是否建立某個概念的方法非常相似。我們正用它進行一些視頻規劃

Related

相關文章

鈦媒體生成式AI

AI變天,Kimi怎麼補齊“月之暗面”?

光錐智能2026.09.23 10:15 · 來自廣西全文7430字00:00 / 20:20模型強只是入場券,月之暗面還需要補更多課文 | 光錐智能,作者|魏琳華,編輯|劉俊宏AI圈的規則就是用來打破的,市場變化之快,讓公司們經常猝不及防。

剛剛

​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰

據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。

剛剛

OpenAI 重磅發佈 GPT-6 Sol 與 Luna 模型:API 價格腰斬,性能直逼頂級旗艦

這兩款新模型採用了與 GPT-6Astra 類似的方法進行訓練,旨在將 Astra 在專業工作、事實性、編程、計算機使用及對齊等方面的頂尖性能,帶入速度更快、更經濟的小尺寸模型中。官方表示,雖然 GPT-6Astra 依然是追求最佳效果和無妥協體驗的首選,但 Sol 與 Luna 在大幅降低成本的同時,展現出了極其強悍的綜合競爭力。

剛剛

OpenAI 宣佈將在 AI 模型開發早期階段引入第三方獨立安全評估

據相關報道,該公司計劃打破傳統的內部閉環測試模式,將第三方獨立機構正式引入 AI 模型開發週期的更早階段,對其進行系統性的安全風險評估。為了確保這一創新機制能夠真正發揮實質性作用,OpenAI 同時明確了此類外部評估得以有效開展的核心優先事項。

剛剛