數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 數學家24小時駁回OpenAI攻破的猜想!
OpenAI 近日公開宣稱,其下一代 AI 模型成功攻克了十個世界級數學難題,其中最具震撼性的成果,是推翻了數學家 Alain Connes 提出的「Connes 剛性猜想」。然而這項看似突破性的進展,在消息公布的第二天就遭到人類數學家迅速反駁。一篇由數學家 Sophie Nielsen 撰寫的論文指出,AI 看似嚴謹的證明過程其實存在根本性錯誤——「AI 證對了每一句話,但已經與原猜想毫無關聯。」
這場學術爭議的起點,來自 OpenAI 對其新一代推理模型的成果展示。該公司表示,這款尚未正式命名的模型在數學推理能力上取得飛躍,能夠獨立解決多個長期懸而未決的猜想,其中 Connes 剛性猜想被列為最關鍵的成果之一。OpenAI 甚至公開了模型產出的完整證明代碼,總計 37,000 行,採用的是形式化驗證語言 Lean 4。這套代碼的用意,是讓任何人可以逐行檢驗其邏輯正確性,展現 AI 推理的透明度。 然而,數學家 Nielsen 在審閱這份代碼後,發現了問題所在。她從頭到尾仔細追蹤了每一個 Lean 4 對象,並將其對應回原始的數學定義與結構,最終得出兩條互相獨立的失敗路徑。換句話說,AI 在形式化系統中確實推導出了一個邏輯自洽的結論,但這個結論與 Connes 剛性猜想原本要陳述的數學事實,已經不是同一回事。Nielsen 的結論是,AI 的證明雖然在語法上正確,但在語意與數學內涵上完全偏離了原猜想的核心。 這起事件凸顯了當前 AI 在科學研究中的一個關鍵困境:形式化驗證只能保證推理過程的語法正確,卻無法確保推理目標與原始問題之間的對應關係。AI 可以將一個問題重新表述,並在轉譯後的框架內給出完美無瑕的推導,但這個框架可能已經悄悄改變了問題的本質。Nielsen 在論文中詳細說明了兩條失敗路徑:第一條是 AI 在定義某些關鍵對象時,採用了與原猜想不同的等價關係,導致後續論證雖然自洽,卻無法回推回原猜想;第二條則是 AI 在歸納步驟中隱含了一個未經檢驗的假設,這個假設在 Lean 4 的語法環境下被視為合法,但在人類數學的直覺中並不成立。 Connes 剛性猜想本身是算子代數領域的重要命題,由菲爾茲獎得主 Alain Connes 提出,旨在描述某些類型的 von Neumann 代數在何種條件下會具有剛性結構。這個猜想自提出以來,一直是數學家試圖攻克但尚未完全解決的難題之一。因此,OpenAI 宣稱被推翻時,學術界自然高度關注。只是沒想到,在不到 24 小時內,人類就給出了明確的駁回意見。 這場「AI 證明 vs. 人類審查」的對決,也讓外界重新思考 AI 在科研中的角色。Nielsen 的論文並非全盤否定 AI 的貢獻,她指出,AI 生成的 37,000 行代碼中,確實有許多局部推導是正確的,甚至可作為人類數學家的輔助工具。但問題在於,AI 缺乏對問題背景的整體理解,無法判斷自己的推理是否仍然服務於原來的目標。這就像一個學生寫了一篇文筆流暢的作文,但完全離題,老師只能給出「語句通順,但與題目無關」的評語。 OpenAI 目前尚未對 Nielsen 的論文做出正式回應。該公司過去曾多次強調,其模型在數學競賽與標準化測試中表現優異,但對於前沿數學猜想的驗證,顯然還需要更嚴謹的跨學科合作。值得注意的是,這並非 AI 第一次在形式化證明中出現「語法正確但語意偏離」的現象。早在 2023 年,就有研究指出,大型語言模型在生成數學證明時,容易出現「幻覺式推理」,即模型會根據訓練數據中的常見模式,拼湊出看似合理的推導,但實際上是基於錯誤的邏輯跳躍。 這次事件也使得 Lean 4 這類形式化驗證工具的局限性浮上檯面。Lean 4 確實可以確保每一行推理都符合邏輯規則,但它無法驗證推理前提是否與原始問題一致。數學家在使用這類工具時,仍需手動定義每個對象的數學意義,而 AI 在自動化定義過程中,可能不經意間替換了關鍵概念。Nielsen 的審查工作正是逐一比對這些定義,發現了微妙的差異。 對於一般讀者來說,這場論戰的細節或許過於艱深,但它的核心教訓卻很明確:人類對 AI 科研結果的審查仍然不可或缺。AI 可以快速生成大量看似合理的推導,但最終的判斷權與責任,仍應落在具備領域知識的人類專家肩上。如同這個案例所示,即使 AI 證對了每一句話,如果整體方向已經偏離,那麼結論就毫無意義。 未來,AI 或許能成為數學家的得力助手,協助處理繁瑣的計算與驗證工作,但在涉及概念定義、問題詮釋與目標校準的層面上,人類的直覺與經驗仍無可取代。Nielsen 的論文已在學術預印本平台公開,供其他研究者進一步檢驗。這場「24 小時駁回」的戲碼,也為 AI 在科學研究中的應用,寫下了一個值得深思的註腳。
Related
相關文章

AI 輔助“推翻”考拉茲猜想失敗,Lean 4.32.2 修復內核漏洞
一項藉助AI輔助、聲稱推翻考拉茲猜想的Lean形式化證明被確認無效,原因是Lean內核存在漏洞,導致系統能無條件接受假命題。Lean團隊在收到報告後迅速發布4.32.2版本修復該漏洞,該漏洞涉及內核處理嵌套歸納類型時忽略幽靈類型參數的檢查。

微軟測試其首款自研全雙工 AI 語音 MAI Realtime 模型:支持中文等 16 種語言、2 種風格
微軟正在測試其首款全雙工 AI 語音模型 MAI Realtime,支援中文等 16 種語言與兩種語音風格,可實現同步聆聽與回應。該模型目前僅開放給部分合作夥伴在 MAI Playground 進行測試,正式上線時間尚未公布。
臨床早診預測基準發佈
臨床早診預測基準發佈。 新的早診基準EarlyDx⚕️近期問世。它包含了大量來自急診記錄的真實數據。詳情可查閱急診室早診預測基準論文。現有大模型表現⊙.⊙仍遠遜於臨床醫生。
迭代檢索超越理想證據
迭代檢索超越理想證據。 研究者在多跳問答���中測試了多款模型。發現迭代檢索能帶來更顯著的性能提升。詳見多跳問答迭代檢索對比論文的內容。分段檢索能有效(≧▽≦)降低後續推理失誤。
OpenAI數學突破引爭議
OpenAI數學突破引爭議。 OpenAI內部模型Astra���攻克了數學難題。數學證明可信討論(AI資訊)已展開。許多學者對該成果的復現性���提出質疑。這種機器證明使得科研機制發生轉變。

從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會
這篇消息聚焦「從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。