Astra跑分引發AGI爭議

2026年9月12日 00:00
站內 AI 整理稿

黃仁勳日前公開宣稱「通用人工智慧(AGI)已經到來」,這番言論迅速點燃AI圈的關注焦點,各界目光再度聚焦於Google DeepMind所開發的Astra模型。然而,就在業界為AGI是否真正實現而熱烈討論之際,Astra在近期一份備受矚目的基準測試中繳出的成績單,卻引發了截然不同的解讀與激烈爭議。這起爭議的導火線來自ARC Prize(Abstraction and Reasoning Corpus Prize)官方所公布的數據。ARC Prize是一個專門設計用來衡量機器抽象推理能力的競賽與測試平台,長期被視為檢驗AI是否具備接近人類智慧的重要指標。

根據該機構揭露的資訊,Astra在OpenAI特別為其量身打造的封閉測試環境中,於ARC-AGI-3測試題庫內獲得了高達99.9%的驚人分數。這個數字幾乎接近滿分,若屬實,似乎印證了黃仁勳所稱「AGI已經到來」的說法。然而,同一套模型在標準、未經任何調整的公開測試環境下,得分卻大幅滑落至62.7%。兩者之間存在將近三十七個百分點的巨大落差,這項對比讓ARC Prize的出題方與許多AI研究者直接表態,不認可Astra已達到真正AGI的水準。出題方與質疑者認為,高達99.9%的成績高度依賴OpenAI刻意提供的「定製環境」,這並不能反映模型在無特殊輔助下解決抽象推理問題的真正能力。

換句話說,Astra的驚人表現可能僅是針對特定測試情境所做的工程優化成果,而非通用推理能力實質躍升的證據。ARC Prize的設計初衷正是要評估AI能否像人類一樣,僅憑少量範例就理解並應用全新的抽象規則。一旦測試環境被刻意調整,模型的表現便喪失了對其泛化能力進行客觀判斷的價值。這種「刷分」現象在AI領域並非首次出現,但Astra在封閉與公開環境之間如此懸殊的成績差異,仍然讓許多專家感到震驚。OpenAI方面並未對此做出詳細回應,但根據業界推測,OpenAI為Astra打造的定製環境可能包含針對ARC-AGI-3題庫特徵的預處理、提示工程優化,甚至隱含了部分訓練資料的調整。

雖然這些做法在學術評測中並不罕見,但當測試成績被用來佐證「AGI已到來」這類重大宣示時,其代表性與公平性就會遭到嚴格檢視。這起由跑分數字所引爆的AGI爭議,也讓業界對於如何客觀衡量機器智慧展開了新一輪討論。長期以來,AI領域缺乏統一的AGI評測標準,各家機構往往自行設計測試環境,導致結果難以直接比較。ARC Prize雖然在抽象推理方面提供了相對嚴謹的框架,但此次Astra的案例顯示,即使在同一測試庫中,只要環境設定不同,成績就可能出現天壤之別。此外,黃仁勳日前公開表態「AGI已經到來」的時機點也引發聯想。部分觀察者認為,這番言論可能與NVIDIA在AI硬體市場的佈局有關,並非單純的學術判斷。

無論如何,Astra在ARC-AGI-3上的成績爭議,已經讓外界對於「AGI是否真的到來」產生更多疑問。許多研究人員呼籲,未來應該建立更透明、更難以透過工程手段操控的評測機制,才能真實反映AI在抽象推理與通用智慧上的進展。在這場爭論中,支持黃仁勳觀點的一方則指出,Astra即使在公開環境下也有62.7%的得分,這已經大幅超越過去模型在ARC-AGI-3上的表現。他們認為,AI的進步是漸進的,不能因為封閉環境的成績偏高就否定其整體進展。然而,反對者強調,如果「AGI」的定義是指具備人類水平的通用推理能力,那麼62.7%顯然還不足以跨越門檻,更何況99.9%的成績是在特殊環境下取得的。

目前,Google DeepMind並未針對ARC Prize的數據發布正式回應。該公司過去曾表示,Astra在許多自然語言與多模態任務上表現出色,但從未直接將其定位為AGI。OpenAI則忙於推動其他產品與技術路線,對於Astra的測試爭議保持低調。這使得外界只能從ARC Prize官方公布的數據與各方專家的評論中拼湊全貌。整體而言,Astra的跑分風波再次凸顯了AI領域一個根本性的難題:當我們聲稱「AGI已到來」,究竟該用什麼標準來檢驗?如果連一套公認的測試環境都無法取得共識,那麼任何高分或低分都很難成為定論。

未來,ARC Prize的主辦單位可能會進一步修改測試規則,防止類似「定製環境刷分」的情況再次發生。而業界對於AGI的定義與測量,恐怕還需要更多時間與討論才能逐漸收斂。無論最終結論如何,這次事件已經讓更多人認識到,AI的進步並非線性,也不是單一跑分能完全反映。黃仁勳的「AGI已到來」或許是一句充滿遠見的宣示,但也可能只是過早的樂觀。在Astra的成績爭議尚未釐清之前,這場關於機器智慧的辯論,顯然還會持續燃燒下去。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

11 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

13 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

14 小時前