GPT-6刷到99.9%,ARC AGI考卷被迫重做,下一關考「發明」

2026年9月16日 11:31
GPT-6刷到99.9%,ARC AGI考卷被迫重做,下一關考「發明」
站內 AI 整理稿

人工通用智慧(AGI)的評測標竿正面臨前所未見的挑戰。由 OpenAI 開發的最新大型語言模型 GPT-6,在最新的 ARC-AGI-3(Abstraction and Reasoning Corpus for Artificial General Intelligence,簡稱 ARC-AGI)評測中一舉拿下 99.9% 的近乎滿分,直接讓這套原本被視為區分 AI 認知層級的試卷喪失鑑別力。面對這項驚人成績,主辦 ARC 評測的團隊緊急宣布不再沿用現有版本,並著手規劃全新一代的考題,將挑戰核心從「解題」轉向「發明」。

ARC-AGI 是一套專門用來衡量 AI 抽象推理能力的標準化測試,其設計初衷是透過一連串圖形模式辨識與邏輯歸納題目,評估模型能否像人類一樣理解規律並推導出正確解答。該測試的題目刻意避開大型語言模型擅長的語言處理與知識記憶,專注於視覺空間的抽象推理,曾被認為是區分當代 AI 與真正通用智慧之間差距的重要工具。然而,GPT-6 的出現徹底改寫了這個格局。據了解,GPT-6 在 ARC-AGI-3 的答題表現幾乎達到完美境界,僅有極少數邊際題目未能完全正確,整體正確率高達 99.9%。這樣的成績意味著現有試卷中的題目對這款模型而言已毫無難度可言,也讓原本設計用來持續追蹤模型能力成長的曲線瞬間觸頂。

主辦方在檢視數據後認為,如果繼續沿用同一份試卷,後續的評測將淪為「天花板測試」,無法再提供有意義的區分度,因此果斷決定關閉當前版本。下一代考題暫定命名為 ARC-4,預計在明年正式推出。與前代題目最大的不同在於,ARC-4 的核心命題將從「找出正確答案」轉向「創造原本不存在的東西」。換句話說,模型不再只需要辨識圖形中的模式並套用規則,而是必須自行生成新的規則、新的工具或全新的解決方案。這個被稱為「發明」的考試方向,被業界視為對大型語言模型能力邊界的一次重大壓力測試。ARC 團隊解釋,這種轉變反映了當前主流 AI 在模仿與歸納能力上雖然已取得驚人進展,但距離真正的通用智能仍有一道關鍵鴻溝。

人類能夠在沒有明確指導的狀況下,根據既有知識創造出前所未見的解法或工具,這種原創性正是目前多數大型語言模型最欠缺的能力。透過 ARC-4,團隊希望能夠量化模型在「發明」層面的表現,進一步釐清 AGI 的發展路徑。雖然 OpenAI 尚未公開 GPT-6 的完整技術細節,但從其對 ARC-AGI-3 的壓倒性表現來看,該公司在參數規模與訓練策略上顯然又跨出了一大步。事實上,GPT-6 的上一代模型 GPT-4 在早期版本的 ARC-AGI 上表現並不突出,甚至需要多次嘗試才能達到中等水準;而 GPT-6 幾乎以零失誤的姿態橫掃考題,顯示出在抽象推理與模式歸納能力上的質變。

然而,ARC 團隊特別強調,單純在舊框架上獲得高分並不代表該模型已經具備通用智能。他們認為,現有的 ARC-AGI 試卷雖然能檢驗模型的推理能力,但若模型透過大規模訓練資料中的相似題型記憶來答題,其實無法真正反映其理解與適應新情境的潛力。這也是為什麼團隊選擇迅速關閉原試卷、轉向更具原創性評量方式的原因。業界普遍關注明年即將登場的 ARC-4,期待它能成為新一代 AI 能力的試金石。

如果 GPT-6 或後續版本能在「發明」領域展現出超越現有模型的創造力,那將是邁向通用智慧的重要里程碑;反之,若模型在需要自行生成規則或工具的題目上表現不佳,則可能再次凸顯當前 AI 在創造力與自主探索方面的根本限制。值得注意的是,ARC 團隊在設計 ARC-4 時,也考慮到題目必須避免被模型以單純的統計模式或記憶庫所破解。他們計畫引入動態生成的題庫,讓每一次測試都包含全新的情境與規則,確保模型無法透過既有資料中的範例直接作答。這項設計將大幅提高評測的公平性與可靠度。

從更大的視角來看,GPT-6 在 ARC-AGI-3 上的表現不僅是技術上的突破,更促使整個 AI 評測體系重新思考何謂「通用智慧」的衡量標準。過去幾年,許多標竿測試都陸續被大型語言模型「刷爆」,迫使研究者不斷提高難度或轉換評量方向。ARC 團隊這次直接跨入「發明」層級,無疑為後續的 AI 能力評估設立了更高的標竿。目前距離 ARC-4 正式上線還有一年左右的時間,OpenAI 及其他 AI 研發團隊勢必會針對這項新挑戰進行準備。究竟 GPT-6 或其他競爭模型能否在「發明」考卷上再次展現壓倒性實力,還是會暴露出創造力不足的弱點,將是未來一年 AI 領域最受矚目的觀察焦點之一。

無論結果如何,這場由 GPT-6 引發的評測改革,已經讓世人對人工通用智慧的邊界有了更清晰的想像。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

11 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

13 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

14 小時前