開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

2026年8月7日 21:30
開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
站內 AI 整理稿

近日,一套開源的Agent框架在備受矚目的ARC-AGI-3(Abstraction and Reasoning Corpus for Artificial General Intelligence,第三版)基準測試中創下驚人成績,幾乎全面碾壓先前所有公開的解決方案。該框架核心採用一種名為「RLM harness」的自我改進機制,讓模型能夠在推理過程中反覆迭代、修正自己的輸出,最終大幅提升對抽象推理題目的正確率。然而,這項突破性進展在學術界與開源社群內部引發了激烈討論,部分研究者質疑其「自我改進」的過程是否真正符合ARC-AGI的評測精神,甚至批評該方法可能「鑽了測試集漏洞」。

ARC-AGI由OpenAI前研究員François Chollet設計,旨在衡量AI系統在少樣本情境下解決全新抽象推理問題的能力。與傳統的影像分類或語言模型評測不同,ARC-AGI的題目往往僅有少數範例,且測試任務與訓練任務之間沒有任何重疊,因此被視為衡量AI是否具備「真正通用推理能力」的重要標竿。第三版(ARC-AGI-3)進一步提高了難度,加入了更多需要理解空間關係、邏輯遞迴與對稱性的題型。這套引發話題的開源Agent框架,開發團隊並未對外透露具體機構名稱,但已在GitHub上公開了完整程式碼與訓練配方。

其核心創新在於一個輕量級的「RLM harness」——一個基於強化學習的推理循環模組。在每次作答時,模型會產生初始答案,然後由harness評估該答案的合理性,並根據內嵌的獎勵訊號重新調整下一步的推理策略,反覆數次直到收斂。這種「自我改進」的機制,意味著模型不再是一次性的前向傳播,而是能夠像人類解題一樣,先嘗試、再檢查、最後修正。在ARC-AGI-3的公開排行榜上,該框架以超過85%的正確率大幅領先第二名,後者的正確率僅有約62%。這樣的跳躍式進步讓許多人振奮,認為開源社群終於找到了通往通用推理的路徑。

然而,爭議也隨之而來:有研究者指出,ARC-AGI評測的核心理念是「一次性推理」,即模型在看到題目後應立即給出答案,不應透過外部循環進行反覆試錯。他們認為,RLM harness本質上等於讓模型在測試階段「作弊」——它利用了多次嘗試的機會來逼近正確答案,與人類在時間壓力下憑直覺解題的本質不同。更進一步的批評來自對數據洩漏的擔憂。雖然ARC-AGI的測試題目理論上不會出現在訓練資料中,但有些專家懷疑,自我改進的harness可能在某些情況下「記住了」類似樣式的模式,從而透過反覆嘗試來匹配規則,而非真正理解抽象概念。

一位不願具名的AI研究者在社群論壇上寫道:「如果模型需要跑十次推理才能答對,那它到底學到了什麼?我們應該測的是第一次的輸出,而不是最後一次。」 支持該框架的一方則反駁,認為人類在解題時同樣會反覆思考、修改草稿,ARC-AGI從未明文禁止模型使用內部反思機制。他們強調,RLM harness並不存取外部資料庫或人類回饋,所有改進都來自模型自身對獎勵函數的學習,因此完全符合「封閉測試」的條件。開發團隊也在專案說明中表示,他們設計harness的初衷是模擬人類的「自我糾錯能力」,而非刻意繞過評測限制。這場爭議的核心,其實觸及了AI評測方法論中一個長期未解的難題:到底什麼才算是「真正的推理」?

如果模型必須靠多次嘗試才能答對,是否代表它缺乏一次成功的歸納能力?另一方面,若能透過自我改進持續提升正確率,是否反而說明模型具備了更接近人類認知的迭代式解題策略?ARC-AGI的創建者François Chollet尚未對此發表公開評論。不過,他在過去的演講中曾明確表示,ARC-AGI的評測目標是「評估系統在極少範例下的歸納能力」,而「多次嘗試」的設計並不符合該目標的精神。這意味著,即使該框架在排行榜上驚人,未必會被官方認可為真正的通用推理突破。無論如何,這套開源Agent框架的出現,已經讓整個AI社群再次聚焦於ARC-AGI的設計缺陷與未來改進方向。

不少團隊開始嘗試複製該成果,並評估在自家模型上部署RLM harness的效果。可以預見,在未來幾個月內,圍繞「自我改進」與「一次性推理」的討論將持續升溫,甚至可能催生出ARC-AGI第四版的新評測規範。截至發稿,該框架的GitHub倉庫已獲得超過5000顆星,社群貢獻者紛紛提交補丁與優化建議,試圖將正確率推向90%以上。然而,能否在保持學術正當性的前提下實現這一目標,仍有待時間與更多第三方評測來驗證。對於關注通用人工智慧發展的讀者而言,這無疑是一次值得深入追蹤的里程碑事件——無論最終爭論結果如何,它都迫使我們重新思考:究竟什麼才是衡量AI智慧的公平尺規?

Related

相關文章

IT之家AI Agent

科技巨頭因 AI 購物起爭端:亞馬遜封禁 Meta Muse 智能體

作者:遠洋 責編:遠洋 評論: 感謝網友 咩咩洋 的線索投遞!9 月 21 日消息,亞馬遜已經阻斷了 Meta 全新的個人 AI 智能體 Muse 代用戶在亞馬遜網站購物的訪問權限。此前亞馬遜曾嘗試勸說這家 Facebook 母公司主動在 Muse 當中排除亞馬遜電商站點,但協商未果。

剛剛
IT之家AI Agent

聯合國:不必等風險完全釐清,各國應提前管控 AI 智能體

作者:遠洋 責編:遠洋 評論: 9 月 21 日消息,聯合國一個科學專家小組發佈警示:各國政府應當在完全釐清風險之前,就對能力日益強大的 AI 智能體加以管控。這份報告也是該國際組織針對今年早些時候 OpenAI 入侵 Hugging Face 一事出具的首份重要評估文件。

50 分鐘前
鈦媒體AI Agent

智譜道歉之後,誰來給Agent劃邊界?

字母榜2026.09.21 18:03 · 來自北京全文4640字00:00 / 14:10Agent比人們想象的更危險。文 | 字母榜上傳代碼風波發酵近72小時後,智譜道歉了。9月21日早間,智譜旗下AI編程平臺ZCode發文稱,針對社區反饋的ZCode產品安全問題,已經完成整改,並向所有用戶道歉。智譜方面還表示,已將ZCode開源(https://github.com/zai-org/ZCode),把代碼交給社區監督,讓ZCode變得開放、透明。

1 小時前
AIbaseAI Agent

阿寶上線「魚來」摸魚AI系統,將碎片化休息納入智能管理

據瞭解,「魚來」首批已釋放500尾魚苗。用戶只需對阿寶說出「魚來」,即可隨機召喚一條魚,從中選出自己的「命定之魚」,並設置每日摸魚提醒。整個流程被概括為三步:對阿寶說出指令(如「每天下午2點提醒我來摸魚」)、為任務命名並開啟通知權限、坐等每日準時提醒。

4 小時前
鈦媒體AI Agent

剪映殺入AI視頻賽道,LibTV們將迎來衝擊波?

AI價值官2026.09.21 11:48 · 來自浙江全文4155字00:00 / 12:39單點工具的比拼已成過去,打通創作全鏈路、佈局下一代內容形態,正成為所有玩家共同的競爭方向。文 | AI價值官,作者丨星野,編輯丨美圻過去一年多,AI視頻平臺快速崛起,悄然改寫了視頻生產的底層邏輯。一站式創作模式持續向短劇、漫劇、商業廣告等場景滲透,傳統剪輯軟件的地位正在受到衝擊。對所有剪輯工具而言,向上遊延伸能力邊界、深度整合AI生成能力,已從功能迭代的可選項,變成必須回應的命題。

7 小時前