開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

重點摘要
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。
開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
近日,一套開源的Agent框架在備受矚目的ARC-AGI-3(Abstraction and Reasoning Corpus for Artificial General Intelligence,第三版)基準測試中創下驚人成績,幾乎全面碾壓先前所有公開的解決方案。該框架核心採用一種名為「RLM harness」的自我改進機制,讓模型能夠在推理過程中反覆迭代、修正自己的輸出,最終大幅提升對抽象推理題目的正確率。然而,這項突破性進展在學術界與開源社群內部引發了激烈討論,部分研究者質疑其「自我改進」的過程是否真正符合ARC-AGI的評測精神,甚至批評該方法可能「鑽了測試集漏洞」。
ARC-AGI由OpenAI前研究員François Chollet設計,旨在衡量AI系統在少樣本情境下解決全新抽象推理問題的能力。與傳統的影像分類或語言模型評測不同,ARC-AGI的題目往往僅有少數範例,且測試任務與訓練任務之間沒有任何重疊,因此被視為衡量AI是否具備「真正通用推理能力」的重要標竿。第三版(ARC-AGI-3)進一步提高了難度,加入了更多需要理解空間關係、邏輯遞迴與對稱性的題型。這套引發話題的開源Agent框架,開發團隊並未對外透露具體機構名稱,但已在GitHub上公開了完整程式碼與訓練配方。
其核心創新在於一個輕量級的「RLM harness」——一個基於強化學習的推理循環模組。在每次作答時,模型會產生初始答案,然後由harness評估該答案的合理性,並根據內嵌的獎勵訊號重新調整下一步的推理策略,反覆數次直到收斂。這種「自我改進」的機制,意味著模型不再是一次性的前向傳播,而是能夠像人類解題一樣,先嘗試、再檢查、最後修正。在ARC-AGI-3的公開排行榜上,該框架以超過85%的正確率大幅領先第二名,後者的正確率僅有約62%。這樣的跳躍式進步讓許多人振奮,認為開源社群終於找到了通往通用推理的路徑。
然而,爭議也隨之而來:有研究者指出,ARC-AGI評測的核心理念是「一次性推理」,即模型在看到題目後應立即給出答案,不應透過外部循環進行反覆試錯。他們認為,RLM harness本質上等於讓模型在測試階段「作弊」——它利用了多次嘗試的機會來逼近正確答案,與人類在時間壓力下憑直覺解題的本質不同。更進一步的批評來自對數據洩漏的擔憂。雖然ARC-AGI的測試題目理論上不會出現在訓練資料中,但有些專家懷疑,自我改進的harness可能在某些情況下「記住了」類似樣式的模式,從而透過反覆嘗試來匹配規則,而非真正理解抽象概念。
一位不願具名的AI研究者在社群論壇上寫道:「如果模型需要跑十次推理才能答對,那它到底學到了什麼?我們應該測的是第一次的輸出,而不是最後一次。」
支持該框架的一方則反駁,認為人類在解題時同樣會反覆思考、修改草稿,ARC-AGI從未明文禁止模型使用內部反思機制。他們強調,RLM harness並不存取外部資料庫或人類回饋,所有改進都來自模型自身對獎勵函數的學習,因此完全符合「封閉測試」的條件。開發團隊也在專案說明中表示,他們設計harness的初衷是模擬人類的「自我糾錯能力」,而非刻意繞過評測限制。這場爭議的核心,其實觸及了AI評測方法論中一個長期未解的難題:到底什麼才算是「真正的推理」?如果模型必須靠多次嘗試才能答對,是否代表它缺乏一次成功的歸納能力?
另一方面,若能透過自我改進持續提升正確率,是否反而說明模型具備了更接近人類認知的迭代式解題策略?ARC-AGI的創建者François Chollet尚未對此發表公開評論。不過,他在過去的演講中曾明確表示,ARC-AGI的評測目標是「評估系統在極少範例下的歸納能力」,而「多次嘗試」的設計並不符合該目標的精神。這意味著,即使該框架在排行榜上驚人,未必會被官方認可為真正的通用推理突破。無論如何,這套開源Agent框架的出現,已經讓整個AI社群再次聚焦於ARC-AGI的設計缺陷與未來改進方向。不少團隊開始嘗試複製該成果,並評估在自家模型上部署RLM harness的效果。
可以預見,在未來幾個月內,圍繞「自我改進」與「一次性推理」的討論將持續升溫,甚至可能催生出ARC-AGI第四版的新評測規範。截至發稿,該框架的GitHub倉庫已獲得超過5000顆星,社群貢獻者紛紛提交補丁與優化建議,試圖將正確率推向90%以上。然而,能否在保持學術正當性的前提下實現這一目標,仍有待時間與更多第三方評測來驗證。對於關注通用人工智慧發展的讀者而言,這無疑是一次值得深入追蹤的里程碑事件——無論最終爭論結果如何,它都迫使我們重新思考:究竟什麼才是衡量AI智慧的公平尺規?
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

GPT-5 上線 1 週年之際:OpenAI 面向 AI 智能體推出 Agent Plugins 規範
在 GPT-5 系列模型推出 1 週年(2025 年 8 月 7 日上線)之際,OpenAI 公司今天(8 月 7 日)宣佈推出 Agent Plugins,是面向 AI 智能體的插件打包標準。