GPT-5.6證偽30年圖論猜想,北大校友5天連破6題

重點摘要
# 30年圖論猜想被AI推翻!GPT-5.6驚天反例曝光,人類數學家面臨「失業」危機? 就在今天,一則消息在數學界與AI圈同時炸開:GPT-5.6 Pro成功證偽了圖論領域一個懸而未決長達30年的猜想——Dinitz-Garg-Goemans(DGG)成本問題。與此同時,一位北大校友藉助GPT-5.6 Sol在五天內連續攻克六道開放已久的Erdős難題。這兩起事件疊加,讓即將揭曉的菲爾茲獎蒙上一層「最後一屆人類獎」的陰影。
# 30年圖論猜想被AI推翻!GPT-5.6驚天反例曝光,人類數學家面臨「失業」危機? 就在今天,一則消息在數學界與AI圈同時炸開:GPT-5.6 Pro成功證偽了圖論領域一個懸而未決長達30年的猜想——Dinitz-Garg-Goemans(DGG)成本問題。與此同時,一位北大校友藉助GPT-5.6 Sol在五天內連續攻克六道開放已久的Erdős難題。這兩起事件疊加,讓即將揭曉的菲爾茲獎蒙上一層「最後一屆人類獎」的陰影。 ## 一張圖、三個數字,30年猜想瞬間崩塌
被推翻的DGG猜想原本源自一個漂亮的分數流結論:只要存在滿足容量限制的分數流,就必然存在一個不可分割流,代價是容量超出量不超過「最大需求」。後來研究者自然追問:能否在不超容的情況下,成本也不上升?這個問題被視作圖論與組合最佳化中的一塊「硬骨頭」,從2023年到2026年的文獻中都標記為尚未解決。 然而,GPT-5.6 Pro給出的反例極其簡潔:三個終端分別有15、10、15的需求,每條終端都有一條零成本的「便宜路」和一條成本30的「貴路」。問題在於三條便宜路兩兩衝突,任何整數解最多只能選一條便宜路,導致剩下兩個終端必須走貴路,總成本至少60。但分數流只需以1/3、2/5、1/3的比例同時使用三條便宜路,即可將成本壓低到58——完美擊碎了「成本不漲」的猜想。 ## 「三句話」引出反例,人類幾週不如AI半小時
公開的聊天記錄顯示,創造這個反例的Dmitry Rybin總共只向模型輸出了三句話:第一句要求構造結構化反例,第二句強調從問題深層理解出發,第三句直接給出完整的、無條件的反例。整個過程不過數十分鐘,而Rybin本人坦言自己當年曾在證明與證偽兩個方向各花數週苦思。 Rybin並非普通使用者——他曾獲國際大學生數學競賽金牌、全國數學奧賽金牌,擁有香港中文大學(深圳)機器學習博士學位。2025年他發表了更快的矩陣自乘轉置算法,同年又優化了因果注意力精確計算。如今他是一間1億美元AI創業公司的聯合創始人,專注於用機器自動搜尋新算法。 ## 北大天才少年,五天攻克六道世紀難題
幾乎同一時間,哥倫比亞大學博士生Shouqiao Wang宣布,他利用GPT-5.6 Sol搭配Codex工作流,在五天內成功破解了六道被列為開放的Erdős問題。他總共嘗試了約13題,成功率46%,其中單題最長連續運行了32小時。Wang將方法歸納為三條原則:只挑數學界已有討論的題目,排除與重大猜想緊密相連的題;精確定義「什麼才算解決」,包括清楚列出常見誤區和弱結論;最後要求獨立對抗Agent反覆挑戰與審計自己的證明,直到挑不出任何實質漏洞。整個流程是一個不斷失敗、診斷、換路線、再審計的「死循環」,而模型正是在循環中自主推翻了多個版本的錯誤論證。
值得注意的是,其中一道難題是著名數學家陶哲軒曾經研究過但未能解開的。Wang輕描淡寫:「我有數學背景,但這套工作流並不需要很深的數學知識。」然而他的「一點背景」其實相當驚人:13歲即在滑鐵盧大學歐幾里得數學競賽奪得世界第一;2016、2017年連獲中國數學奧林匹克銀牌;2017年拿下全國高中數學聯賽第一名;2018年進入北京大學數學科學學院。現今他在哥倫比亞大學商學院攻讀決策、風險與運營博士,轉向機制設計與博弈論。## 「人類最後一屆菲爾茲獎」?數學家的焦慮與期待
DGG猜想的推翻與Erdős難題的連續破解,發生的時機剛好與新一屆菲爾茲獎公布重疊。消息傳出後,學術社群出現一個廣為流傳的說法:「這可能是人類最後一屆菲爾茲獎了。」儘管略顯誇張,卻反映了AI衝擊下數學家的真實心態。 長期以來,數學被視為人類智力的終極堡壘,為數不多的「AI難以觸及」的領域。但如今,AI可以在幾小時內擊碎三十年懸案、在數天內解決多道開放問題,其工作效率和研究範圍已遠超個體人類數學家。更多學者開始認識到,AI並非取代人類的工具,而是能與人類共生的「科研搭檔」,幫助研究者拓展認知邊界、避開思維盲區。 ## 終局或序章?AI距離菲爾茲獎還有多遠
未來學界討論的重心,已經不再是「AI會不會做數學」,而是「AI什麼時候會拿下屬於自己的菲爾茲獎」。從單兵作戰到多Agent對抗審計,從需要人類引導到自主生成證明,AI的演進速度超出所有人的預期。 或許正如Dmitry Rybin所說,這段人機對話本身就已是絕佳的笑話——人類在以極其認真的態度,思考著自己是否還配得上最高榮譽。但無論如何,這不是終局,而是一個全新紀元的開端。在AI與人類協同探索的未來,數學的邊界將被推到更遠的地方。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
騰訊雲開源 TencentDB Agent Memory v2.0:專為 AI 編碼代理打造的團隊級記憶中樞
Tencent Cloud has open-sourced TencentDB Agent Memory v2.0, a team-level memory hub for AI agents. The idea is super simple: if project context was already explained once, a new session should not need it repeated.
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。