老黃替OpenAI宣佈AGI,出題人當場打臉:換個考場99.9%掉到62.7%

2026年9月11日 18:00
老黃替OpenAI宣佈AGI,出題人當場打臉:換個考場99.9%掉到62.7%
站內 AI 整理稿

輝達(NVIDIA)執行長黃仁勳日前在一場公開活動中,替OpenAI宣布已達成通用人工智慧(AGI),這番話立刻在現場引發議論。不過,同一場合中,負責設計相關測試題目的出題人當場提出反駁,直指這項宣稱恐怕禁不起檢驗,因為只要更換測試環境,模型的表現就會出現斷崖式下滑,準確率從原本的99.9%驟降至62.7%。這場交鋒的核心,在於AGI的判定標準究竟是什麼。

黃仁勳以產業領袖身分為OpenAI背書,形同在公開場合替對方貼上「已實現AGI」的標籤,但出題人隨即以實測數據打臉,強調同一個模型在原本的考場中幾乎完美過關,一旦換到不同的測試條件,成績立刻縮水超過37個百分點,兩者落差之大,足以動搖AGI的成立基礎。據了解,這類爭議并非首度出現。長期以來,AI模型在特定基準測試中拿下高分,經常被視為技術突破的訊號,但學界與實務圈也不斷提醒,基準測試本身可能存在漏洞,包括題目重複、訓練資料汙染,或是模型過度擬合特定題型。換言之,模型可能在「看過的考卷」上表現優異,卻無法將同樣的能力遷移到全新情境。出題人的反駁之所以引發關注,在於其身分正是設計測試題目的人。

由出題者親自出面質疑應試者的成績,等於從源頭指出評量機制的局限性。當99.9%與62.7%這兩個數字並排陳列,外界很難不對AGI的宣稱打上問號,因為真正通用的智慧,理應在不同環境、不同任務之間維持穩定表現,而非只在特定考場中發光。黃仁勳此次發言,也讓外界重新審視科技大廠高層對AGI的定義與使用方式。過去幾年,AGI一詞經常被企業領袖用來描述技術藍圖或願景,但學術界對其門檻始終沒有共識。當產業界人士以一句話宣布AGI降臨,卻在實測中遭到出題人當場糾正,顯示AGI的判定不應由單一企業或個人說了算,而需要更嚴謹、可重複驗證的標準。

從技術角度來看,模型在不同測試環境下表現落差如此明顯,可能涉及多種因素。包括測試題目的分布差異、語言或情境的變化、以及模型是否曾在訓練階段接觸過類似題型。當考場一換,模型無法依賴記憶或模式匹配,必須展現真正的推理與遷移能力時,成績便會回歸到較為真實的水準。這也正是出題人用來質疑AGI宣稱的關鍵論據。這起事件同時凸顯AI評測體系的脆弱環節。目前業界普遍採用的基準測試,多半由特定機構或團隊設計,題目內容與評分方式未必能涵蓋真實世界的複雜度。一旦模型在單一基準上取得高分,便容易被放大解讀為全面性的突破。

出題人此次以換考場的方式實測,等於提醒外界,單一成績不足以作為AGI的證據,跨環境的穩定性才是更關鍵的指標。對OpenAI而言,被黃仁勳代為宣布AGI,原本可能是一項正面消息,但隨著出題人當場提出數據反駁,焦點迅速從「是否達成AGI」轉向「測試成績是否可信」。這種反轉也讓外界注意到,AI公司與評測機構之間的關係日益緊張,前者希望透過亮眼成績證明技術實力,後者則致力於設計更難被攻破的測試,雙方形同處於一場不斷升級的攻防戰。值得注意的是,黃仁勳與OpenAI之間存在密切的產業合作關係,輝達長期為OpenAI提供訓練與推論所需的算力基礎。

在此背景下,黃仁勳替OpenAI宣布AGI,難免被解讀為帶有產業立場的發言。出題人的反駁,則從評測專業出發,形成兩種不同視角的碰撞,一方著眼於技術願景與商業布局,另一方則堅持以可驗證的數據說話。整體而言,這場發生在公開場合的交鋒,反映出當前AI領域對AGI認定的根本分歧。99.9%與62.7%之間的巨大差距,不僅是一個數字對比,更象徵著模型能力在特定條件與通用條件下的落差。當產業領袖急於宣告AGI時代來臨,評測端卻以實測結果提醒外界,真正的通用智慧仍有待更嚴格的檢驗。這場爭議短期內恐怕不會有定論,但已讓外界更清楚地看見,AGI的宣稱與實測之間,仍存在一道不容忽視的鴻溝。

Related

相關文章

達卯科技算電協同2.0平臺入選2026國際數字能源展重大成果發佈

成果中唯一聚焦算電協同全鏈路運營的AI技術產品 9月15日-17日,2026能源綠色發展大會・國際數字能源展在深圳舉辦。展會首次以“一會一展”深度融合模式打造全球數字能源產業盛會,集中發佈近百項前沿創新成果。達卯科技自主研發的「算電協同2.0平臺・AIDC綠電直連能源運營操作系統」成功入選重大成果發佈,也是成果中唯一聚焦算電協同全鏈路運營的AI技術產品。

15 分鐘前
全天候科技產業與商業

小鵬要把賣車和賣技術一起推向全球

王小娟 發表於 2026年09月18日 14:05 摘要:技術合作再尋新客戶。9月17日晚,小鵬集團董事長、CEO何小鵬談起G9L的價格,說自己和總裁王鳳英曾在會議室裡反覆爭論。幾小時前,這款車剛以23.18萬元的 限時起售價上市,較8月公佈的預售起售價低了2.

2 小時前

Claude“主導”Anthropic 26%的AI研發、3萬Agent同時運行:當AI開始“造AI”,頭部公司RSI路線正在分化

根據報導,人工智慧領域近期出現一項值得關注的動向:Anthropic 的 AI 模型 Claude 在其內部研發工作中扮演了主導角色,佔據該公司約 26% 的 AI 研發比例,同時有高達 3 萬個 Agent 在同一時間並行運作。這項數據反映出 AI 開始「製造 AI」的趨勢正在加速,而頭部公司在遞歸自我改進(RSI)路線上的分化也愈發明顯。 Claude 不再只是對外服務的產品,而是成為 Anthropic 內部研發流程的核心引擎。

7 小時前

智譜實現RSI最小閉環,A社:我來監督

智譜AI近日對外宣布,已在遞歸自我改進(Recursive Self-Improvement,簡稱RSI)領域取得關鍵技術突破,成功實現業界首個「最小閉環」系統。與此同時,被業內簡稱為「A社」的AI安全研究機構同步表態,將以第三方監督角色介入該系統的測試與驗證流程,確保技術發展符合倫理與安全規範。 所謂的最小閉環,指的是系統能在不依賴外部人工反饋的情況下,自主完成從自我評估、參數調整到性能驗證的完整循環。

7 小時前

傳聞四起,人形機器人IPO審核收緊?

近期市場傳出多項風聲,指稱人形機器人領域的首次公開募股(IPO)審核可能出現收緊趨勢。雖然官方尚未發布明確指引,但這波傳言已在投資人與業界之間引發討論,不少人開始關注監管層是否會對這類新興科技公司的上市門檻提出更高要求。 與此同時,宇樹科技在資本市場上的戲劇性波動,也被視為影響整體情緒的關鍵變數。

8 小時前