LeCun連續轉發,新作VISReg攻克JEPA世界模型「表徵坍塌」核心難題

2026年7月28日 18:08
LeCun連續轉發,新作VISReg攻克JEPA世界模型「表徵坍塌」核心難題

重點摘要

VISReg 是一種新型自監督學習正則化方法,透過將表徵的「尺度」與「形狀」解耦,解決了JEPA世界模型中的表徵坍塌難題。該方法在15個數據集上表現優於多種主流方法,且僅需約1/10的訓練數據即可在分佈外基準上追平DINOv2,展現出優異的數據效率與泛化能力。

站內 AI 整理稿

圖靈獎得主、Meta 首席 AI 科學家 Yann LeCun 近日在個人社群平台上連續轉發了一篇自監督學習領域的新研究,並以「VICReg 孕育了 SIGReg,SIGReg 又孕育了 VISReg」一句話點明該技術路線的傳承脈絡。這項名為 VISReg(Variance-Invariance-Sketching Regularization)的工作,直接針對 LeCun 長期倡導的 JEPA 世界模型底層核心難題——表徵坍塌(representation collapse),提出了一套不依賴任何啟發式訓練技巧的正則化解法。 自監督學習(SSL)被視為 JEPA 世界模型的基石,其目標是讓模型不必依賴人工標註,就能從海量未標記數據中學到通用的特徵表徵。然而,SSL 在訓練過程中普遍面臨表徵坍塌的困境:模型傾向於將所有不同輸入映射到相同或少數幾個向量上,看似完成了收斂,實際上卻完全喪失了判別能力。為了解決這個問題,主流方法往往需要引入一系列啟發式技巧,例如指數移動平均(EMA)、教師-學生網絡、停止梯度、凍結特定層等。這些技巧雖然能在一定程度上緩解坍塌,卻也讓訓練流程變得脆弱、難以調參,同時削弱了方法的可解釋性與可擴展性。 另一條研究路線則是透過正則項直接約束表徵的分佈。LeCun 團隊先前提出的 VICReg 將學習目標拆解為方差、不變性與協方差三項,其中協方差項用來約束表徵各維度之間的相關性。不過,協方差僅能刻畫二階統計量,無法區分「均值與方差相同,但分佈形狀截然不同」的兩種表徵。隨後提出的 SIGReg 則基於 Cramér–Wold 定理,引入 sketching 技術將整個嵌入分佈對齊到標準高斯分佈,從而約束完整的分佈形狀。然而,SIGReg 存在兩個關鍵缺陷:第一,當表徵開始坍塌時,其梯度隨之衰減,坍塌越嚴重,修正信號越弱,導致模型難以自行恢復;第二,它未將「幅度大小(尺度)」與「分佈形態(形狀)」兩個獨立屬性分離,二者在優化過程中相互干擾,在長尾、低品質或低秩數據上表現不佳。 VISReg 正是為了解決這些問題而誕生。研究團隊將防止坍塌的正則項解耦為「尺度」與「形狀」兩個獨立目標,在不依賴任何啟發式訓練技巧、也不依賴海量數據的前提下,於 15 個數據集上綜合表現超越 7 種主流自監督學習方法;其中僅用約十分之一的訓練數據,即在分佈外(OOD)基準上追平了 DINOv2。 從方法上看,VISReg 對 VICReg 與 SIGReg 取長補短。它保留了 VICReg 的方差項來控制尺度,同時用基於切片 Wasserstein 距離(Sliced Wasserstein Distance, SWD)的 sketching 目標替代協方差項來控制形狀,並透過停止梯度將二者徹底解耦。整個正則目標由三部分組成:第一部分是尺度正則,約束每一維的方差,防止幅值坍縮,且當模型坍縮時,該項的梯度趨近於常數,確保模型能穩定恢復;第二部分是形狀正則,先歸一化以消除尺度影響,再對標準差施加停止梯度,使得形狀損失的優化不會反過來改變尺度,接著用切片 Wasserstein 距離將分佈的幾何形狀對齊到各向同性高斯;第三部分是中心化損失,將 batch 均值拉向原點。預測損失則沿用 JEPA 的不變性目標,讓各視角的嵌入向全局視角的均值對齊。 這套正則目標在實作上非常輕量,核心邏輯只需約 15 行 PyTorch 程式碼。在計算複雜度與擴展性方面,VISReg 的正則部分複雜度為 O(NKD),對所有擴展因子都是線性的;相比之下,VICReg 的協方差項為 O(ND²),隨維度平方增長。在同等 batch 規模下,VISReg 在單塊 H100 GPU 上的運行速度與顯存佔用均優於 SIGReg。更重要的是,K 個隨機切片可以分攤到多塊 GPU 上,在 M 塊 GPU 上每塊各生成 K/M 個切片,效果等價於單卡生成全部 K 個,這使得在大規模訓練中保持常數 K 成為可能。 實驗結果顯示,VISReg 在多個維度上展現出顯著優勢。在域內線性探測方面,不使用任何啟發式技巧的設定下,ViT-B/16 的域內線性探測精度達 75.7%,高於 MAE(75.1%);ViT-L/14 進一步提升至 77.0%,高於 LeJEPA(75.6%)。在分佈外泛化測試中,研究團隊在覆蓋醫療、天文、遙感、紋理等 6 個與 ImageNet 訓練域完全無關的數據集上評測,VISReg 在所有方法、所有骨幹規模上都取得了最佳的平均 OOD 精度,ViT-B/16 達 70.19%,ViT-L/14 達 70.63%,明顯高於 MAE(67.85%),並優於 MoCoV3、DINO、I-JEPA 等方法。 在數據效率方面,VISReg(ViT-L/14)在 ImageNet-22K(約 1400 萬張圖像)上預訓練後,其 6 個 OOD 數據集的平均精度達 72.94%,與在 10 倍規模的 LVD-142M(1.42 億張圖像)上訓練的 DINOv2(72.93%)基本持平,也就是說以約十分之一的數據達到了同等水準。在遷移微調測試中,VISReg 在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 全部五個數據集上均超過 DINO 與有監督預訓練,表明其表徵分佈更均勻、冗餘更低、可遷移性更強。 此外,VISReg 的優勢不限於分類任務。在 ADE20K 線性語義分割上,ViT-B/16 的 mIoU 為 30.16,高於 DINO(29.40)與 MAE(23.60),僅次於 MoCoV3(31.69)。在生成引導方面,由 VISReg 特徵引導的圖像生成在 gFID、Precision、Recall 三項指標上優於 DINO。在長尾分佈(ImageNet-LT)與低秩(Galaxy10)等低品質數據集上,VISReg 能穩定防止坍塌並學到有意義的表徵,而 DINO 在缺乏精細調參時直接失敗。 這項研究揭示了將表徵正則解耦為「尺度」與「形狀」兩個獨立組件,可以獲得比現有方法更穩定、更高效、泛化性更強的自監督學習方案。在不使用任何訓練啟發式技巧的前提下,VISReg 在圖像識別、分割與生成引導等多個維度上取得了領先或接近領先的結果,並以約十分之一的數據達到了 DINOv2 的 OOD 水準,為 JEPA 世界模型長期存在的表徵坍塌問題提供了一種新的正則化解法。論文與程式碼已於 arXiv 與 GitHub 上公開。

Related

相關文章

老黃版「曼哈頓計劃」來了,砸50億給Ilya,又批2500億天價擔保OpenAI

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

豪擲50億美元!離開OpenAI後,他拿下黃仁勳投資

豪擲50億美元!離開OpenAI後,他拿下黃仁勳投資新質動能2026.07.28 18:52 · 來自北京全文3892字00:00 / 11:02英偉達50億美元投資SSI。文 | 新質動能沉寂兩年的AI黑馬SSI,被英偉達重金砸中。當地時間7月27日,英偉達宣佈同意向前OpenAI首席科學家Ilya Sutskever創辦的人工智能初創公司Safe Superintelligence(簡稱SSI)投資約50億美元。

剛剛

UCLA博士團隊創業做人形機器人基礎模型,拿下近5億元天使++輪融資|硬氪首發

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

賣 Token還是賣結果:AI 商業模式的幾個悖論

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

你看的無盡連載,作者可能已經不當人了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛