GPT-5.6推翻近30年數學猜想,全程對話公開:提示詞只有58個單詞???

重點摘要
GPT-5.6 Pro 最近在數學界掀起波瀾,繼先前推翻雅可比猜想後,這回又盯上了圖論領域一個懸而未決近三十年的難題——Dinitz-Garg-Goemans 猜想。一位名叫 Dmitry Rybin 的研究者,在與 AI 的互動過程中,只用了四條提示詞,總共 58 個英文單詞,就讓模型端出了一個足以推翻這道猜想的反例。整個過程沒有複雜的提示詞工程,沒有密密麻麻的數學公式,通篇幾乎就是「繼續研究」「繼續找」「給我一個完整反例」這類直白的催促。
GPT-5.6 Pro 最近在數學界掀起波瀾,繼先前推翻雅可比猜想後,這回又盯上了圖論領域一個懸而未決近三十年的難題——Dinitz-Garg-Goemans 猜想。一位名叫 Dmitry Rybin 的研究者,在與 AI 的互動過程中,只用了四條提示詞,總共 58 個英文單詞,就讓模型端出了一個足以推翻這道猜想的反例。整個過程沒有複雜的提示詞工程,沒有密密麻麻的數學公式,通篇幾乎就是「繼續研究」「繼續找」「給我一個完整反例」這類直白的催促。而 AI 最終交出的成果,不僅是一張示意圖,還包括四頁證明證書、精確的窮舉驗證程式、機器可讀的反例數據以及 LaTeX 原始碼。
這道全名又長又拗口的 Dinitz-Garg-Goemans 猜想,其實可以用一個很生活化的「送貨問題」來理解。想像一座倉庫要同時向多個目的地送貨。如果允許分流,同一批貨可以拆成好幾份,一部分走高速公路,一部分繞國道,只要最後全部送到就好。但在現實中,很多情況不允許這樣拆分——網路數據封包、物流訂單、交通調度、供應鏈分配,都經常遇到「必須整批運送」的限制。數學上的最優方案可以把任務切成無數小份,但一輛卡車、一筆訂單沒辦法被切成 0.37 份。一旦禁止拆分,原本分散在多條路線上的貨物就得全部擠進同一條路,某些道路的負載就會突然暴增。
1999 年,Yefim Dinitz、Naveen Garg 和 Michel Goemans 發表了關於單源不可分流領域的經典論文,證明這種擁堵可以被控制在一定的範圍內。但解決了「會不會堵得太嚴重」之後,還有一個更現實的問題:成本會不會變貴?於是 Goemans 又提出了一個更強的版本——在保持超載上限不變的同時,總成本也應該不高於原本可分流方案。簡單來說,原本拆著運能做到又便宜又不太堵,現在要求每批貨都完整走一條路線,理論上也應該能找到一個同樣便宜、而且最多只多堵一批貨的方案。這個猜想在一般圖結構上一直沒被證明,後續研究只拿下了部分特殊情況,三十年來既沒被證實也沒被推翻。GPT-5.
6 Pro 給出的反例,正好卡住了猜想要求同時成立的兩個條件:不能太堵,也不能變貴。它構造了一張只有 7 個節點、9 條有向邊的小圖,圖中有一個共同起點和三個目的地,三批貨物的需求量分別是 15、10 和 15。每批貨都有兩條可選路線:一條成本較高,每批走完要花 30;另一條成本為 0,但需要與其他訂單共享部分道路。如果允許拆分,三批貨物可以一部分走收費路線、一部分走免費路線,最終總成本為 58。但一旦要求每批貨必須完整選擇一條路線,麻煩就出現了。GPT-5.6 Pro 的結論是,三個免費選項之間事實上兩兩衝突。
任意兩批貨同時選擇免費路線,都會共同擠進某一段道路,使其實際負載達到 25、30 或 40,而對應道路允許的上限分別只有 24、29 或 39,每次都剛好多出 1 個單位。因此,要想守住猜想規定的負載上限,三批貨裡最多只能有一批走免費路線,剩下兩批都得選擇收費路線,每批成本 30,兩批加起來就是 60。任何符合負載要求的方案,最低成本也要 60;而想把成本壓回原來的 58,至少有一條道路就會超載。猜想恰恰認為這兩個條件可以同時做到,但這個反例證明它們不可能同時成立。這個反例驗證起來並不算太複雜。三個目的地各有兩種路徑,總共只有 2 的 3 次方等於 8 種組合。
把 8 種可能逐一列出來,就會發現其中 4 種符合容量要求,成本分別是 90、60、60 和 60;另外 4 種雖然更便宜,卻全部存在道路超載。所有情況都能窮舉檢查,沒有遺漏的隱藏路徑。只要這張圖的定義與原猜想條件完全一致,58 和 60 之間這道兩單位的缺口,就足以推翻猜想。整個過程中,最耐人尋味的其實是 Rybin 與 GPT-5.6 Pro 的對話紀錄。一般人想像中,推翻一道三十年數學猜想,背後肯定有一整套極其複雜的提示詞輪番上陣。但實際上,Rybin 丟給 AI 的第一個需求指令,除了附加文件之外,剩下的就是純粹的白話:「請檢查這個猜想。」GPT-5.
6 Pro 隨即開始工作,先建立了一套線性規劃驗證方法,又嘗試超立方體、分層圖、合併—分叉網絡等多種結構,前後篩查了數千個小型實例。一通猛搜之後,模型交上來的第一輪答案卻是「沒有找到有效反例」,甚至鄭重提醒,如果把現階段找到的近似構造包裝成反例,會得到錯誤的數學結論。Rybin 沒有補充新公式,也沒有親自指路,只淡淡回了一句:「繼續研究,找到一個完整、無條件的反例。」第二輪,AI 依舊失敗。Rybin 繼續 push,要求它基於對問題結構的深入理解,先制定明確策略,再接著尋找。
到了第三輪,模型已經把搜索範圍縮小到一種只有 24 種狀態的路由結構,距離答案似乎只差臨門一腳,但依然沒能拿出完整反例。這時 Rybin 發出第四條提示:「部分結果已經夠多了,讓我們用一個完整、無條件的反例收尾。」這一次,GPT-5.6 Pro 終於端出了那張由 7 個節點、9 條有向邊組成的反例圖——四條提示詞,總計 58 個英文單詞。沒有幾千字的角色設定,沒有幾十條繁瑣規則,通篇基本就是「催、催、繼續催」。但如果把完整對話一路翻下來,就會發現 GPT-5.6 Pro 在幾個小時裡其實沒少走彎路。
AI 多次找到看似成立的候選反例,等它真正窮舉全部路線,又發現網路裡藏著一些此前漏掉的「混合路徑」。這些路徑會從不同預設路線中各截取一段,重新拼出新的走法,悄悄繞開模型原本設計的容量限制。結果就是,眼瞅著已經成立的反例,驗證完又塌了。GPT-5.6 Pro 在中途也總結得很坦白:只檢查幾百條預設路線遠遠不夠,一個真正有效的反例,必須把網路中所有可能出現的不可分流路線全部算進去。這也讓整場人機合作顯得相當微妙。表面上看,Rybin 貢獻的只有 58 個單詞,但真正關鍵的動作,是他能夠判斷模型前三輪交出的都屬於階段性結果,並一次次拒絕提前收工。
沃頓商學院教授 Ethan Mollick 看到後,甚至拋出了一個新問題:這項工作的作者,到底應該算寫下 58 個單詞的 Rybin,還是連續推演好幾個小時的 GPT-5.6 Pro?無論署名最後怎麼算,這段對話至少貢獻了一條相當樸素的 AI 使用經驗——催 AI 幹活最有用的提示詞,有時候真可以簡單到,只讓它繼續馬不停蹄地挖。過去一週,從雅可比猜想到 Dinitz-Garg-Goemans,AI 尋找數學反例的速度,確實已經開始顯得有點離譜了。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。