何愷明團隊新作:看貓片就能學會ARC挑戰

2026年10月1日 23:10
何愷明團隊新作:看貓片就能學會ARC挑戰
站內 AI 整理稿

何愷明團隊最新論文提出了NAT-ARC,一套純視覺的ARC解題方案。它不靠LLM,用ImageNet上的貓狗花草做預訓練,讓模型學會「看」,再遷移到抽象格子推理上。結果,NAT-ARC表現最好的單模型在ARC-1上跑出了63.4%的pass@2分數,集成後達到70.2%。這是純視覺方案首次逼近專用LLM系統的水平。ARC,公認最難的AI視覺智力測驗之一,給你幾個彩色格子的輸入輸出示例,讓你推斷背後隱藏的變換規則,再應用到新格子上。過去的主流解法清一色把格子翻譯成文字或符號,交給LLM推理。這篇論文偏不,甚至預訓練階段連ARC格子都沒用上。

模型看真實世界學來的視覺能力,就水靈靈地遷移到了完全抽象的彩色格子推理上。ARC賽道,視覺方案崛起 ARC全稱Abstraction and Reasoning Corpus,由Keras之父François Chollet在2019年提出。ARC裡每道題的格式很統一,一塊最大30×30的二維格子,最多10種顏色,題目給2到5組輸入輸出示例,挑戰者需要從示例中推斷出隱藏的變換規則,再把這條規則應用到一個全新的輸入格子上,預測它的輸出。這些問題聽起來像看圖找規律的兒童智力題,但ARC對AI來說極難。一方面,每道題的變化規則都不一樣,沒有固定模板可背。

還有就是數據量極少,兩三個示例就要歸納出抽象規則,並且精確執行。這種組合讓ARC成了測量AI抽象推理能力的標杆。目前ARC賽道上佔據統治地位的幾乎全是大語言模型方案,這些方案的共同思路都是把格子翻譯成文本或符號序列,交給語言模型處理。視覺路線後來才開始崛起。一批研究者走了一條完全不同的路,他們不把格子翻譯成文字,改成了用視覺模型直接處理格子圖像。其中最重要的一步來自同一個MIT團隊提出的VARC,這個方法把ARC重新定義為條件圖生圖翻譯任務,用19M參數的視覺模型跑到54%。LoopViT在這個框架上加入循環推理機制,18M參數達到65.8%。

Loop-OWM用視頻預訓練模型做few-shot,10.6M參數達到68.5%。這些模型的參數量比LLM方案小了幾個數量級,但效果已經開始追平。但視覺路線依然有一個結構性短板。LLM之所以能在ARC上越做越好,核心原因之一是它們通過海量語料預訓練,積累下了通用能力,模型越大、預訓練越充分,在下游任務上的scaling就越明顯。而多數視覺ARC方案的模型從隨機初始化開始訓練,沒有吃到預訓練的紅利。在此基礎上,NAT-ARC的目標就是給視覺路線補上預訓練這一步,試著打通它的scaling瓶頸。

看完貓貓,挑戰ARC NAT-ARC的核心思路,是在VARC的視覺流程前面插入一步ImageNet MAE預訓練。MAE,Masked Autoencoder,是何愷明在FAIR時期2022年提出的自監督視覺預訓練方法。其訓練過程,是把一張圖片遮住大部分區域,讓模型從剩下的碎片裡把原圖復原出來。通過這個任務,模型就可以理解物體的形狀、結構和空間關係。NAT-ARC的做法是把MAE在ImageNet(包含約130萬張貓狗花草等自然圖像的數據集)上訓出來的encoder權重直接拿來初始化視覺編碼器,decoder則從隨機初始化開始訓練。整個流程分三步。

第一步,用ImageNet上的MAE預訓練encoder; 第二步,在ARC訓練集上離線訓練整個編解碼器; 第三步,在測試時對每道題單獨做LoRA微調。微調階段,每道題只有2到5組示範對,模型用這幾組示範試圖從中“學會”這道題的規則。有個細節值得注意,NAT-ARC直接用了MAE的公開checkpoint,沒有額外花一分錢預訓練。不過,這個checkpoint原本是為更大尺寸的ImageNet圖片設計的,而ARC格子只有64×64像素,尺寸差異很大。為了適配,NAT-ARC丟棄了原始的patch embedding和位置編碼,只保留backbone權重,換成2D RoPE作為位置編碼。

簡單說,NAT-ARC只保留了MAE在ImageNet上學到的視覺特徵提取能力,而把與ImageNet圖像尺寸綁定的空間感知部分全部丟掉,用更靈活的方式重新學習。但為什麼看貓狗照片學到的東西,能幫到抽象格子推理?論文用注意力可視化給出了一條線索。研究人員把三種初始化方式(無預訓練、ImageNet MAE預訓練和ARC風格格子MAE預訓練)的模型放在同一道ARC題前,觀察它們在還沒開始訓練ARC之前的注意力分佈。結果很明顯,隨機初始化的模型注意力均勻分散,毫無重點;而ImageNet預訓練過的模型已經能區分前景和背景,注意力自動聚焦到格子中有意義的圖案區域上。

這個模型從來沒見過ARC格子,它在ImageNet上學到的「把物體從背景裡認出來」的能力,在ARC格子上天然生效了。研究人員進一步做了任務級拆解。他們篩出了15道預訓練後顯著提升的ARC題目,手動標註後發現這些題集中在兩類任務上。其中6道屬於match-and-copy,模型需要識別出匹配的對象、顏色或圖案,再把對應的結構複製到輸出中; 另外6道屬於connected-component reasoning,模型需要識別、填充或重新著色空間上連通的區域。這兩類能力恰好對應自然圖像裡的視覺先驗。

在ImageNet上看貓學到的「把貓從草地背景裡分出來」,到了ARC裡變成了「把這塊連通的彩色區域從格子裡認出來」。視覺世界和抽象世界的底層邏輯,在物體分組、圖案匹配、區域分割這些操作上,原來共享同一套表徵。從貓貓中來,到貓貓中去 NAT-ARC最終在ARC-1上的成績如下。表現最好的單模型採用huge尺度,參數量0.6B,pass@2成績達到63.4±0.7%。集成時,研究人員把三種不同預訓練策略(無預訓練、ImageNet MAE預訓練、ARC風格格子MAE預訓練)分別訓出的模型池化在一起做多數投票,拿到70.2±0.6% pass@2,總參數量約2B。

作為參照,專門針對ARC微調的The ARChitects拿到71.6%,用的是8B的語言模型。視覺路線用四分之一的參數量,打到了專用LLM系統的城下。數字之外,這篇論文最重要的一個發現,就是預訓練打通了視覺路線的scaling瓶頸。沒有預訓練時,模型越大效果反而越差;加上預訓練後,scaling才開始代理正收益。先看訓練曲線。在離線訓練階段,用了ImageNet預訓練的模型收斂速度明顯更快,在base、large、huge三個尺度上都是如此,最終精度也更高。但最有意思的發現藏在scaling曲線裡。沒有預訓練時,模型從base到large性能還能漲,但從large到huge反而掉點了。

模型變大,效果變差,這在深度學習裡不是常見現象,說明ARC這個任務的數據量實在太少,模型容量增長帶來的不是更強的泛化而是過擬合。而加上ImageNet預訓練後,scaling曲線變得健康了,base、large、huge三個尺度一路向上,模型越大效果越好。論文裡最酷的一個實驗是一個可視化驗證。研究人員訓了一個autoencoder,把ImageNet圖像映射到一個60×60、10種顏色的離散格子表示上,相當於把一張貓片「翻譯」成了ARC格子。然後,他們用NAT-ARC對這個格子執行ARC變換,旋轉180°、加一圈藍色邊框,再解碼回像素。結果,貓確實被轉了,邊框也確實加上了。

這個從貓貓裡訓練出的模型,又在任務裡回到了貓貓之中。這個實驗把「自然圖像和ARC格子共享同一套表徵空間」從統計數字變成了可視化證據。在ARC格子上學會的變換規則,可以直接應用到自然圖像的潛在表示上,反過來也一樣。抽象規則和視覺表徵之間的連接,是這兩個世界本來就有的。作者簡介 論文一作Xiaoman Delores Ding,MIT CSAIL成員,來自何愷明組。她同時也是VARC的一作,這篇NAT-ARC相當於在自己上一篇工作的基礎上繼續往前推。其餘作者包括胡珂雅(Keya Hu),是何愷明首批女弟子之一,本科畢業於上海交通大學。

還有Katelyn Gan和Victor Yin,同樣來自MIT,兩人都是本科生,且均在CSAIL擔任student researcher。通訊作者何愷明不必多說,他是ResNet和MAE的作者,從這兩個工作幾乎可以串起近十年視覺AI的主線。他從進入MIT後持續產出視覺基礎工作,這篇論文用的正是他自己四年前提出的MAE作為預訓練工具,等於用自己的舊武器打通了一條新路。VARC已被CVPR 2026接收,NAT-ARC是它的直接後續。這個團隊連續兩篇論文堅持純視覺路線解ARC,在LLM大行其道的賽道上,它們正在用實驗數據不斷突破視覺路線的天花板。論文地址:https://eccv.ecva.

net/virtual/2026/poster/5527 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓

。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

剛剛
鈦媒體生成式AI

階躍星辰“第一梯隊”,是“自嗨”嗎?

AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

剛剛
鈦媒體生成式AI

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?

新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

53 分鐘前
鈦媒體生成式AI

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思

字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.

53 分鐘前
鈦媒體生成式AI

豪擲82億美元,芯片巨頭押注的世界模型究竟是什麼

FoST未來敘事2026.10.01 16:04 · 來自北京全文3694字00:00 / 10:23當AI開始生成“世界”,影音遊內容正在被顛覆。文 | FoST未來敘事,作者 | 蔥蔥82億美元,芯片巨頭AMD以全股票形式收購世界模型公司World Labs。AMD在收購公告裡寫道:“World Labs 的模型經驗,將幫助AMD更深入地理解工作負載如何演變,進而塑造未來的技術路線圖。”換句話說,AMD看中的,不只是World Labs今天的模型能力,更是世界模型這類前沿模型可能給芯片硬件研發帶來的“前瞻性”。

1 小時前