老黃替OpenAI宣佈AGI,出題人當場打臉:換個考場99.9%掉到62.7%

輝達(NVIDIA)執行長黃仁勳日前在一場公開活動中,替OpenAI宣布已達成通用人工智慧(AGI),這番話立刻在現場引發議論。不過,同一場合中,負責設計相關測試題目的出題人當場提出反駁,直指這項宣稱恐怕禁不起檢驗,因為只要更換測試環境,模型的表現就會出現斷崖式下滑,準確率從原本的99.9%驟降至62.7%。這場交鋒的核心,在於AGI的判定標準究竟是什麼。
黃仁勳以產業領袖身分為OpenAI背書,形同在公開場合替對方貼上「已實現AGI」的標籤,但出題人隨即以實測數據打臉,強調同一個模型在原本的考場中幾乎完美過關,一旦換到不同的測試條件,成績立刻縮水超過37個百分點,兩者落差之大,足以動搖AGI的成立基礎。據了解,這類爭議并非首度出現。長期以來,AI模型在特定基準測試中拿下高分,經常被視為技術突破的訊號,但學界與實務圈也不斷提醒,基準測試本身可能存在漏洞,包括題目重複、訓練資料汙染,或是模型過度擬合特定題型。換言之,模型可能在「看過的考卷」上表現優異,卻無法將同樣的能力遷移到全新情境。出題人的反駁之所以引發關注,在於其身分正是設計測試題目的人。
由出題者親自出面質疑應試者的成績,等於從源頭指出評量機制的局限性。當99.9%與62.7%這兩個數字並排陳列,外界很難不對AGI的宣稱打上問號,因為真正通用的智慧,理應在不同環境、不同任務之間維持穩定表現,而非只在特定考場中發光。黃仁勳此次發言,也讓外界重新審視科技大廠高層對AGI的定義與使用方式。過去幾年,AGI一詞經常被企業領袖用來描述技術藍圖或願景,但學術界對其門檻始終沒有共識。當產業界人士以一句話宣布AGI降臨,卻在實測中遭到出題人當場糾正,顯示AGI的判定不應由單一企業或個人說了算,而需要更嚴謹、可重複驗證的標準。
從技術角度來看,模型在不同測試環境下表現落差如此明顯,可能涉及多種因素。包括測試題目的分布差異、語言或情境的變化、以及模型是否曾在訓練階段接觸過類似題型。當考場一換,模型無法依賴記憶或模式匹配,必須展現真正的推理與遷移能力時,成績便會回歸到較為真實的水準。這也正是出題人用來質疑AGI宣稱的關鍵論據。這起事件同時凸顯AI評測體系的脆弱環節。目前業界普遍採用的基準測試,多半由特定機構或團隊設計,題目內容與評分方式未必能涵蓋真實世界的複雜度。一旦模型在單一基準上取得高分,便容易被放大解讀為全面性的突破。
出題人此次以換考場的方式實測,等於提醒外界,單一成績不足以作為AGI的證據,跨環境的穩定性才是更關鍵的指標。對OpenAI而言,被黃仁勳代為宣布AGI,原本可能是一項正面消息,但隨著出題人當場提出數據反駁,焦點迅速從「是否達成AGI」轉向「測試成績是否可信」。這種反轉也讓外界注意到,AI公司與評測機構之間的關係日益緊張,前者希望透過亮眼成績證明技術實力,後者則致力於設計更難被攻破的測試,雙方形同處於一場不斷升級的攻防戰。值得注意的是,黃仁勳與OpenAI之間存在密切的產業合作關係,輝達長期為OpenAI提供訓練與推論所需的算力基礎。
在此背景下,黃仁勳替OpenAI宣布AGI,難免被解讀為帶有產業立場的發言。出題人的反駁,則從評測專業出發,形成兩種不同視角的碰撞,一方著眼於技術願景與商業布局,另一方則堅持以可驗證的數據說話。整體而言,這場發生在公開場合的交鋒,反映出當前AI領域對AGI認定的根本分歧。99.9%與62.7%之間的巨大差距,不僅是一個數字對比,更象徵著模型能力在特定條件與通用條件下的落差。當產業領袖急於宣告AGI時代來臨,評測端卻以實測結果提醒外界,真正的通用智慧仍有待更嚴格的檢驗。這場爭議短期內恐怕不會有定論,但已讓外界更清楚地看見,AGI的宣稱與實測之間,仍存在一道不容忽視的鴻溝。
Related
相關文章

Edge AI Daily 早報(9月19日)
Edge AI Daily2026.09.19 08:30 · 來自北京全文6222字00:00 / 17:23Anthropic與埃森哲20億美元安全合作,行業安全評估門檻形成;前FTC官員警告AI實驗室卡特爾引發市場震盪;SEC授予代幣化證券五年豁免;英國工黨推動新AI監管機構。

達卯科技算電協同2.0平臺入選2026國際數字能源展重大成果發佈
成果中唯一聚焦算電協同全鏈路運營的AI技術產品 9月15日-17日,2026能源綠色發展大會・國際數字能源展在深圳舉辦。展會首次以“一會一展”深度融合模式打造全球數字能源產業盛會,集中發佈近百項前沿創新成果。達卯科技自主研發的「算電協同2.0平臺・AIDC綠電直連能源運營操作系統」成功入選重大成果發佈,也是成果中唯一聚焦算電協同全鏈路運營的AI技術產品。

消息稱特斯拉針對 Optimus 機器人業務啟動量產審廠,多家供應鏈企業回應
作者:清源 責編:清源 評論: 感謝網友 麻辣清補涼、不一樣的體驗 的線索投遞!9 月 18 日消息,日前,21 世紀經濟報道援引產業鏈人士消息稱,特斯拉相關團隊已於 9 月 16 日落地寧波,並於 17 日開啟新一輪針對旗下機器人業務的量產審廠。

小鵬要把賣車和賣技術一起推向全球
王小娟 發表於 2026年09月18日 14:05 摘要:技術合作再尋新客戶。9月17日晚,小鵬集團董事長、CEO何小鵬談起G9L的價格,說自己和總裁王鳳英曾在會議室裡反覆爭論。幾小時前,這款車剛以23.18萬元的 限時起售價上市,較8月公佈的預售起售價低了2.

Claude“主導”Anthropic 26%的AI研發、3萬Agent同時運行:當AI開始“造AI”,頭部公司RSI路線正在分化
根據報導,人工智慧領域近期出現一項值得關注的動向:Anthropic 的 AI 模型 Claude 在其內部研發工作中扮演了主導角色,佔據該公司約 26% 的 AI 研發比例,同時有高達 3 萬個 Agent 在同一時間並行運作。這項數據反映出 AI 開始「製造 AI」的趨勢正在加速,而頭部公司在遞歸自我改進(RSI)路線上的分化也愈發明顯。 Claude 不再只是對外服務的產品,而是成為 Anthropic 內部研發流程的核心引擎。

智譜實現RSI最小閉環,A社:我來監督
智譜AI近日對外宣布,已在遞歸自我改進(Recursive Self-Improvement,簡稱RSI)領域取得關鍵技術突破,成功實現業界首個「最小閉環」系統。與此同時,被業內簡稱為「A社」的AI安全研究機構同步表態,將以第三方監督角色介入該系統的測試與驗證流程,確保技術發展符合倫理與安全規範。 所謂的最小閉環,指的是系統能在不依賴外部人工反饋的情況下,自主完成從自我評估、參數調整到性能驗證的完整循環。