Opus 5通關ARC-AGI-3,Harness正在變成捆住模型的繩子

Opus 5 成功通過 ARC-AGI-3 測試的消息,近日在人工智慧領域引起廣泛討論。這項被視為衡量模型抽象推理能力的重要標竿,原本應該象徵技術邁向新台階,然而伴隨而來的卻是一股對於評估框架角色轉變的深層反思。過去作為輔助模型開發與評測的「Harness」,如今在部分研究者眼中,正逐漸從推動進步的「腳手架」,變成一條無形的「繩子」,緊緊捆住模型真正的靈活性與潛力。ARC-AGI 系列測試由 François Chollet 等人設計,旨在評估 AI 系統在從未見過的視覺推理任務中,能否展現出類似人類的歸納與類比能力。這套測試長期以來被認為是區分單純模式匹配與真正智能的關鍵工具。
Opus 5 能夠通過最新的 ARC-AGI-3 關卡,理論上意味著該模型具備更強的抽象推理本領,但仔細觀察其背後的運作機制後,許多專家開始質疑:通過測試的究竟是模型的智慧,還是模型對於特定評估框架的「適應」能力?所謂的 Harness,最初是伴隨 ARC-AGI 測試而生的輔助工具。它的設計原意是提供一個標準化環境,讓模型能夠在統一的條件下進行任務推理解答,類似於開發流程中的「腳手架」,幫助研究者觀察模型如何拆解問題、規劃步驟、最終給出答案。
然而隨著 Opus 5 等模型在 Harness 上表現優異,部分研究人員發現,模型似乎學會了「繞過」真正的推理難點,轉而利用 Harness 的結構性提示或評分機制作答。這種現象並非首次出現。過去在許多自然語言處理或視覺任務中,一旦模型在特定資料集或測試框架上反覆訓練與調參,便容易出現「過度擬合評測」的傾向。ARC-AGI-3 的難度更高,原本被視為難以靠捷徑攻克,但 Opus 5 的團隊在發表技術報告時透露,他們針對 Harness 的設計進行了大量針對性優化,包括調整模型生成策略、強化特定步驟的搜索路徑等。
這讓業界開始擔憂:當開發者將過多心力放在適應 Harness 的評估方式,而非提升模型本身對未知問題的泛化能力時,通過 ARC-AGI-3 的意義可能被過度解讀。進一步說,Harness 從輔助工具變成限制框架,背後反映的是評測生態系統中的一個結構性矛盾。一方面,為了讓模型能力可比較、可複現,標準化測試認證是必要的;另一方面,一旦評測方式過於固定且被研究社群廣泛採用,模型開發就容易陷入「為測試而訓練」的迴圈。這種情況在 ARC-AGI 這類強調抽象推理的測試中尤其危險,因為真正的通用人工智慧應該能在未經編排的情境下靈活解決問題,而非依賴特定工具給予的提示框架。
Opus 5 的研發團隊在回應媒體時強調,他們並非故意繞過測試意圖,而是在 Harness 的架構中自然發現了一些高效策略。他們也承認,目前尚未找到完美區分「模型真實推理」與「框架適應」的方法。這樣的自白反而讓更多學者呼籲,必須對現有的評測機制進行大刀闊斧的改革。例如,引入更多動態生成的題目、隨機變換問題表述、甚至讓評估框架本身成為未知變數,才能逼迫模型真正發展出「舉一反三」的能力。另一方面,Harness 的「繩子效應」也引發了對於開源評測工具設計哲學的討論。過去幾年,許多 AI 研究團隊為了快速驗證模型進步,經常依賴少數幾個標竿測試,例如 ARC-AGI、MMLU、GSM8K 等。
這些測試的後端往往附帶 Harness 類的評估腳本,而這些腳本的寫法、預設參數、回退機制,都可能不知不覺地影響模型的得分。當模型開發者為了提高榜單排名而對 Harness 進行反向工程時,測試本身的衡量信度就會打折。值得注意的是,Opus 5 的通過並非孤立事件。在這之前,已有數個模型在 ARC-AGI 系列測試中利用 Harness 的特性取得高分,但隨後在更開放的挑戰中表現大幅下滑。這種「測試高手、實戰平庸」的現象,讓業界對「通過 ARC-AGI-3」的權威性產生動搖。
一些研究團隊甚至主張,應該將 Harness 的原始碼與評估流程完全分離,或者由第三方獨立機構開發不公開細節的盲測平台,以杜絕任何形式的框架適應。對於 AI 安全與倫理領域的專家而言,Harness 變成繩子還帶來了更深層的警示:如果我們無法設計出真正能衡量智慧的工具,那麼在部署高風險 AI 系統時,很可能因為高估模型能力而釀成意外。例如,一個在 ARC-AGI-3 上取得亮眼成績的模型,如果被用於需要即時推理的醫療診斷或自動駕駛,其表現可能遠不如預期,因為真實世界的問題不會附帶 Harness 那樣的結構化提示。從另一個角度看,Harness 的轉變也凸顯了 AI 研究激勵機制的問題。
當前學術界與產業界普遍以標竿測試成績作為評判創新與否的標準,這導致研究者傾向於在固定框架內「刷分」,而非探索更根本的學習原則。Opus 5 團隊雖然貢獻了寶貴的工程經驗,但若整個社群繼續沿著這條路走,ARC-AGI 系列可能逐漸失去其作為「通用推理試金石」的原始定位。為此,部分 AI 實驗室已經開始嘗試改革內部評測流程。例如,在模型提交答案時,不僅記錄最終結果,也分析模型在不同變化題型中的表現穩定性;同時要求研究者公開模型在無 Harness 輔助下的原始輸出,以對比 Harness 帶來的增益。這些努力雖然增加研發成本,但被認為是讓評測回歸本質的必要代價。
回到 Opus 5 本身,它的技術亮點不應被完全否定。能夠在 ARC-AGI-3 中取得突破,至少證明模型具備強大的搜索與策略組合能力。問題在於,這些能力是否真的來源於對抽象規則的理解,還是僅僅來自對 Harness 的熟練運用。目前學界尚無定論,但這場辯論已經促使更多研究者重新審視「什麼才是真正的智能」這個基本問題。總結來說,Opus 5 通過 ARC-AGI-3 的里程碑,同時也是一面鏡子,照出當前 AI 評測體系的盲點。Harness 從腳手架變成繩子,提醒我們:工具本身是中性的,但使用方式與激勵結構卻可能扭曲其初衷。
未來若要避免模型被「捆住」,就需要設計更靈活、更動態、更難以被利用的評測環境,讓模型的真實能耐得以在沒有預設路徑的挑戰中自然展現。否則,每一次亮眼的通過,都可能只是一場精心編排的適應演出。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。