LeCun連續轉發,新作VISReg攻克JEPA世界模型「表徵坍塌」核心難題

2026年7月28日 18:08
LeCun連續轉發,新作VISReg攻克JEPA世界模型「表徵坍塌」核心難題

重點摘要

VISReg 是一種新型自監督學習正則化方法,透過將表徵的「尺度」與「形狀」解耦,解決了JEPA世界模型中的表徵坍塌難題。該方法在15個數據集上表現優於多種主流方法,且僅需約1/10的訓練數據即可在分佈外基準上追平DINOv2,展現出優異的數據效率與泛化能力。

站內 AI 整理稿

圖靈獎得主、Meta 首席 AI 科學家 Yann LeCun 近日在個人社群平台上連續轉發了一篇自監督學習領域的新研究,並以「VICReg 孕育了 SIGReg,SIGReg 又孕育了 VISReg」一句話點明該技術路線的傳承脈絡。這項名為 VISReg(Variance-Invariance-Sketching Regularization)的工作,直接針對 LeCun 長期倡導的 JEPA 世界模型底層核心難題——表徵坍塌(representation collapse),提出了一套不依賴任何啟發式訓練技巧的正則化解法。

自監督學習(SSL)被視為 JEPA 世界模型的基石,其目標是讓模型不必依賴人工標註,就能從海量未標記數據中學到通用的特徵表徵。然而,SSL 在訓練過程中普遍面臨表徵坍塌的困境:模型傾向於將所有不同輸入映射到相同或少數幾個向量上,看似完成了收斂,實際上卻完全喪失了判別能力。為了解決這個問題,主流方法往往需要引入一系列啟發式技巧,例如指數移動平均(EMA)、教師-學生網絡、停止梯度、凍結特定層等。這些技巧雖然能在一定程度上緩解坍塌,卻也讓訓練流程變得脆弱、難以調參,同時削弱了方法的可解釋性與可擴展性。另一條研究路線則是透過正則項直接約束表徵的分佈。

LeCun 團隊先前提出的 VICReg 將學習目標拆解為方差、不變性與協方差三項,其中協方差項用來約束表徵各維度之間的相關性。不過,協方差僅能刻畫二階統計量,無法區分「均值與方差相同,但分佈形狀截然不同」的兩種表徵。隨後提出的 SIGReg 則基於 Cramér–Wold 定理,引入 sketching 技術將整個嵌入分佈對齊到標準高斯分佈,從而約束完整的分佈形狀。

然而,SIGReg 存在兩個關鍵缺陷:第一,當表徵開始坍塌時,其梯度隨之衰減,坍塌越嚴重,修正信號越弱,導致模型難以自行恢復;第二,它未將「幅度大小(尺度)」與「分佈形態(形狀)」兩個獨立屬性分離,二者在優化過程中相互干擾,在長尾、低品質或低秩數據上表現不佳。VISReg 正是為了解決這些問題而誕生。研究團隊將防止坍塌的正則項解耦為「尺度」與「形狀」兩個獨立目標,在不依賴任何啟發式訓練技巧、也不依賴海量數據的前提下,於 15 個數據集上綜合表現超越 7 種主流自監督學習方法;其中僅用約十分之一的訓練數據,即在分佈外(OOD)基準上追平了 DINOv2。

從方法上看,VISReg 對 VICReg 與 SIGReg 取長補短。它保留了 VICReg 的方差項來控制尺度,同時用基於切片 Wasserstein 距離(Sliced Wasserstein Distance, SWD)的 sketching 目標替代協方差項來控制形狀,並透過停止梯度將二者徹底解耦。

整個正則目標由三部分組成:第一部分是尺度正則,約束每一維的方差,防止幅值坍縮,且當模型坍縮時,該項的梯度趨近於常數,確保模型能穩定恢復;第二部分是形狀正則,先歸一化以消除尺度影響,再對標準差施加停止梯度,使得形狀損失的優化不會反過來改變尺度,接著用切片 Wasserstein 距離將分佈的幾何形狀對齊到各向同性高斯;第三部分是中心化損失,將 batch 均值拉向原點。預測損失則沿用 JEPA 的不變性目標,讓各視角的嵌入向全局視角的均值對齊。這套正則目標在實作上非常輕量,核心邏輯只需約 15 行 PyTorch 程式碼。

在計算複雜度與擴展性方面,VISReg 的正則部分複雜度為 O(NKD),對所有擴展因子都是線性的;相比之下,VICReg 的協方差項為 O(ND²),隨維度平方增長。在同等 batch 規模下,VISReg 在單塊 H100 GPU 上的運行速度與顯存佔用均優於 SIGReg。更重要的是,K 個隨機切片可以分攤到多塊 GPU 上,在 M 塊 GPU 上每塊各生成 K/M 個切片,效果等價於單卡生成全部 K 個,這使得在大規模訓練中保持常數 K 成為可能。實驗結果顯示,VISReg 在多個維度上展現出顯著優勢。

在域內線性探測方面,不使用任何啟發式技巧的設定下,ViT-B/16 的域內線性探測精度達 75.7%,高於 MAE(75.1%);ViT-L/14 進一步提升至 77.0%,高於 LeJEPA(75.6%)。在分佈外泛化測試中,研究團隊在覆蓋醫療、天文、遙感、紋理等 6 個與 ImageNet 訓練域完全無關的數據集上評測,VISReg 在所有方法、所有骨幹規模上都取得了最佳的平均 OOD 精度,ViT-B/16 達 70.19%,ViT-L/14 達 70.63%,明顯高於 MAE(67.85%),並優於 MoCoV3、DINO、I-JEPA 等方法。

在數據效率方面,VISReg(ViT-L/14)在 ImageNet-22K(約 1400 萬張圖像)上預訓練後,其 6 個 OOD 數據集的平均精度達 72.94%,與在 10 倍規模的 LVD-142M(1.42 億張圖像)上訓練的 DINOv2(72.93%)基本持平,也就是說以約十分之一的數據達到了同等水準。在遷移微調測試中,VISReg 在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 全部五個數據集上均超過 DINO 與有監督預訓練,表明其表徵分佈更均勻、冗餘更低、可遷移性更強。此外,VISReg 的優勢不限於分類任務。

在 ADE20K 線性語義分割上,ViT-B/16 的 mIoU 為 30.16,高於 DINO(29.40)與 MAE(23.60),僅次於 MoCoV3(31.69)。在生成引導方面,由 VISReg 特徵引導的圖像生成在 gFID、Precision、Recall 三項指標上優於 DINO。在長尾分佈(ImageNet-LT)與低秩(Galaxy10)等低品質數據集上,VISReg 能穩定防止坍塌並學到有意義的表徵,而 DINO 在缺乏精細調參時直接失敗。這項研究揭示了將表徵正則解耦為「尺度」與「形狀」兩個獨立組件,可以獲得比現有方法更穩定、更高效、泛化性更強的自監督學習方案。

在不使用任何訓練啟發式技巧的前提下,VISReg 在圖像識別、分割與生成引導等多個維度上取得了領先或接近領先的結果,並以約十分之一的數據達到了 DINOv2 的 OOD 水準,為 JEPA 世界模型長期存在的表徵坍塌問題提供了一種新的正則化解法。論文與程式碼已於 arXiv 與 GitHub 上公開。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

剛剛

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

剛剛

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

剛剛

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

剛剛

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

剛剛

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

剛剛