數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”

2026年8月4日 17:34
數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 數學家24小時駁回OpenAI攻破的猜想!

站內 AI 整理稿

OpenAI 近日公開宣稱,其下一代 AI 模型成功攻克了十個世界級數學難題,其中最具震撼性的成果,是推翻了數學家 Alain Connes 提出的「Connes 剛性猜想」。然而這項看似突破性的進展,在消息公布的第二天就遭到人類數學家迅速反駁。一篇由數學家 Sophie Nielsen 撰寫的論文指出,AI 看似嚴謹的證明過程其實存在根本性錯誤——「AI 證對了每一句話,但已經與原猜想毫無關聯。」

這場學術爭議的起點,來自 OpenAI 對其新一代推理模型的成果展示。該公司表示,這款尚未正式命名的模型在數學推理能力上取得飛躍,能夠獨立解決多個長期懸而未決的猜想,其中 Connes 剛性猜想被列為最關鍵的成果之一。OpenAI 甚至公開了模型產出的完整證明代碼,總計 37,000 行,採用的是形式化驗證語言 Lean 4。這套代碼的用意,是讓任何人可以逐行檢驗其邏輯正確性,展現 AI 推理的透明度。然而,數學家 Nielsen 在審閱這份代碼後,發現了問題所在。她從頭到尾仔細追蹤了每一個 Lean 4 對象,並將其對應回原始的數學定義與結構,最終得出兩條互相獨立的失敗路徑。

換句話說,AI 在形式化系統中確實推導出了一個邏輯自洽的結論,但這個結論與 Connes 剛性猜想原本要陳述的數學事實,已經不是同一回事。Nielsen 的結論是,AI 的證明雖然在語法上正確,但在語意與數學內涵上完全偏離了原猜想的核心。這起事件凸顯了當前 AI 在科學研究中的一個關鍵困境:形式化驗證只能保證推理過程的語法正確,卻無法確保推理目標與原始問題之間的對應關係。AI 可以將一個問題重新表述,並在轉譯後的框架內給出完美無瑕的推導,但這個框架可能已經悄悄改變了問題的本質。

Nielsen 在論文中詳細說明了兩條失敗路徑:第一條是 AI 在定義某些關鍵對象時,採用了與原猜想不同的等價關係,導致後續論證雖然自洽,卻無法回推回原猜想;第二條則是 AI 在歸納步驟中隱含了一個未經檢驗的假設,這個假設在 Lean 4 的語法環境下被視為合法,但在人類數學的直覺中並不成立。Connes 剛性猜想本身是算子代數領域的重要命題,由菲爾茲獎得主 Alain Connes 提出,旨在描述某些類型的 von Neumann 代數在何種條件下會具有剛性結構。這個猜想自提出以來,一直是數學家試圖攻克但尚未完全解決的難題之一。因此,OpenAI 宣稱被推翻時,學術界自然高度關注。

只是沒想到,在不到 24 小時內,人類就給出了明確的駁回意見。這場「AI 證明 vs.人類審查」的對決,也讓外界重新思考 AI 在科研中的角色。Nielsen 的論文並非全盤否定 AI 的貢獻,她指出,AI 生成的 37,000 行代碼中,確實有許多局部推導是正確的,甚至可作為人類數學家的輔助工具。但問題在於,AI 缺乏對問題背景的整體理解,無法判斷自己的推理是否仍然服務於原來的目標。這就像一個學生寫了一篇文筆流暢的作文,但完全離題,老師只能給出「語句通順,但與題目無關」的評語。OpenAI 目前尚未對 Nielsen 的論文做出正式回應。

該公司過去曾多次強調,其模型在數學競賽與標準化測試中表現優異,但對於前沿數學猜想的驗證,顯然還需要更嚴謹的跨學科合作。值得注意的是,這並非 AI 第一次在形式化證明中出現「語法正確但語意偏離」的現象。早在 2023 年,就有研究指出,大型語言模型在生成數學證明時,容易出現「幻覺式推理」,即模型會根據訓練數據中的常見模式,拼湊出看似合理的推導,但實際上是基於錯誤的邏輯跳躍。這次事件也使得 Lean 4 這類形式化驗證工具的局限性浮上檯面。Lean 4 確實可以確保每一行推理都符合邏輯規則,但它無法驗證推理前提是否與原始問題一致。

數學家在使用這類工具時,仍需手動定義每個對象的數學意義,而 AI 在自動化定義過程中,可能不經意間替換了關鍵概念。Nielsen 的審查工作正是逐一比對這些定義,發現了微妙的差異。對於一般讀者來說,這場論戰的細節或許過於艱深,但它的核心教訓卻很明確:人類對 AI 科研結果的審查仍然不可或缺。AI 可以快速生成大量看似合理的推導,但最終的判斷權與責任,仍應落在具備領域知識的人類專家肩上。如同這個案例所示,即使 AI 證對了每一句話,如果整體方向已經偏離,那麼結論就毫無意義。

未來,AI 或許能成為數學家的得力助手,協助處理繁瑣的計算與驗證工作,但在涉及概念定義、問題詮釋與目標校準的層面上,人類的直覺與經驗仍無可取代。Nielsen 的論文已在學術預印本平台公開,供其他研究者進一步檢驗。這場「24 小時駁回」的戲碼,也為 AI 在科學研究中的應用,寫下了一個值得深思的註腳。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

10 小時前