GPT-5.6推翻近30年數學猜想,全程對話公開:提示詞只有58個單詞???

重點摘要
GPT-5.6 Pro 最近在數學界掀起波瀾,繼先前推翻雅可比猜想後,這回又盯上了圖論領域一個懸而未決近三十年的難題——Dinitz-Garg-Goemans 猜想。一位名叫 Dmitry Rybin 的研究者,在與 AI 的互動過程中,只用了四條提示詞,總共 58 個英文單詞,就讓模型端出了一個足以推翻這道猜想的反例。整個過程沒有複雜的提示詞工程,沒有密密麻麻的數學公式,通篇幾乎就是「繼續研究」「繼續找」「給我一個完整反例」這類直白的催促。
GPT-5.6 Pro 最近在數學界掀起波瀾,繼先前推翻雅可比猜想後,這回又盯上了圖論領域一個懸而未決近三十年的難題——Dinitz-Garg-Goemans 猜想。一位名叫 Dmitry Rybin 的研究者,在與 AI 的互動過程中,只用了四條提示詞,總共 58 個英文單詞,就讓模型端出了一個足以推翻這道猜想的反例。整個過程沒有複雜的提示詞工程,沒有密密麻麻的數學公式,通篇幾乎就是「繼續研究」「繼續找」「給我一個完整反例」這類直白的催促。而 AI 最終交出的成果,不僅是一張示意圖,還包括四頁證明證書、精確的窮舉驗證程式、機器可讀的反例數據以及 LaTeX 原始碼。 這道全名又長又拗口的 Dinitz-Garg-Goemans 猜想,其實可以用一個很生活化的「送貨問題」來理解。想像一座倉庫要同時向多個目的地送貨。如果允許分流,同一批貨可以拆成好幾份,一部分走高速公路,一部分繞國道,只要最後全部送到就好。但在現實中,很多情況不允許這樣拆分——網路數據封包、物流訂單、交通調度、供應鏈分配,都經常遇到「必須整批運送」的限制。數學上的最優方案可以把任務切成無數小份,但一輛卡車、一筆訂單沒辦法被切成 0.37 份。一旦禁止拆分,原本分散在多條路線上的貨物就得全部擠進同一條路,某些道路的負載就會突然暴增。 1999 年,Yefim Dinitz、Naveen Garg 和 Michel Goemans 發表了關於單源不可分流領域的經典論文,證明這種擁堵可以被控制在一定的範圍內。但解決了「會不會堵得太嚴重」之後,還有一個更現實的問題:成本會不會變貴?於是 Goemans 又提出了一個更強的版本——在保持超載上限不變的同時,總成本也應該不高於原本可分流方案。簡單來說,原本拆著運能做到又便宜又不太堵,現在要求每批貨都完整走一條路線,理論上也應該能找到一個同樣便宜、而且最多只多堵一批貨的方案。這個猜想在一般圖結構上一直沒被證明,後續研究只拿下了部分特殊情況,三十年來既沒被證實也沒被推翻。 GPT-5.6 Pro 給出的反例,正好卡住了猜想要求同時成立的兩個條件:不能太堵,也不能變貴。它構造了一張只有 7 個節點、9 條有向邊的小圖,圖中有一個共同起點和三個目的地,三批貨物的需求量分別是 15、10 和 15。每批貨都有兩條可選路線:一條成本較高,每批走完要花 30;另一條成本為 0,但需要與其他訂單共享部分道路。如果允許拆分,三批貨物可以一部分走收費路線、一部分走免費路線,最終總成本為 58。但一旦要求每批貨必須完整選擇一條路線,麻煩就出現了。 GPT-5.6 Pro 的結論是,三個免費選項之間事實上兩兩衝突。任意兩批貨同時選擇免費路線,都會共同擠進某一段道路,使其實際負載達到 25、30 或 40,而對應道路允許的上限分別只有 24、29 或 39,每次都剛好多出 1 個單位。因此,要想守住猜想規定的負載上限,三批貨裡最多只能有一批走免費路線,剩下兩批都得選擇收費路線,每批成本 30,兩批加起來就是 60。任何符合負載要求的方案,最低成本也要 60;而想把成本壓回原來的 58,至少有一條道路就會超載。猜想恰恰認為這兩個條件可以同時做到,但這個反例證明它們不可能同時成立。 這個反例驗證起來並不算太複雜。三個目的地各有兩種路徑,總共只有 2 的 3 次方等於 8 種組合。把 8 種可能逐一列出來,就會發現其中 4 種符合容量要求,成本分別是 90、60、60 和 60;另外 4 種雖然更便宜,卻全部存在道路超載。所有情況都能窮舉檢查,沒有遺漏的隱藏路徑。只要這張圖的定義與原猜想條件完全一致,58 和 60 之間這道兩單位的缺口,就足以推翻猜想。 整個過程中,最耐人尋味的其實是 Rybin 與 GPT-5.6 Pro 的對話紀錄。一般人想像中,推翻一道三十年數學猜想,背後肯定有一整套極其複雜的提示詞輪番上陣。但實際上,Rybin 丟給 AI 的第一個需求指令,除了附加文件之外,剩下的就是純粹的白話:「請檢查這個猜想。」GPT-5.6 Pro 隨即開始工作,先建立了一套線性規劃驗證方法,又嘗試超立方體、分層圖、合併—分叉網絡等多種結構,前後篩查了數千個小型實例。一通猛搜之後,模型交上來的第一輪答案卻是「沒有找到有效反例」,甚至鄭重提醒,如果把現階段找到的近似構造包裝成反例,會得到錯誤的數學結論。 Rybin 沒有補充新公式,也沒有親自指路,只淡淡回了一句:「繼續研究,找到一個完整、無條件的反例。」第二輪,AI 依舊失敗。Rybin 繼續 push,要求它基於對問題結構的深入理解,先制定明確策略,再接著尋找。到了第三輪,模型已經把搜索範圍縮小到一種只有 24 種狀態的路由結構,距離答案似乎只差臨門一腳,但依然沒能拿出完整反例。這時 Rybin 發出第四條提示:「部分結果已經夠多了,讓我們用一個完整、無條件的反例收尾。」這一次,GPT-5.6 Pro 終於端出了那張由 7 個節點、9 條有向邊組成的反例圖——四條提示詞,總計 58 個英文單詞。沒有幾千字的角色設定,沒有幾十條繁瑣規則,通篇基本就是「催、催、繼續催」。 但如果把完整對話一路翻下來,就會發現 GPT-5.6 Pro 在幾個小時裡其實沒少走彎路。AI 多次找到看似成立的候選反例,等它真正窮舉全部路線,又發現網路裡藏著一些此前漏掉的「混合路徑」。這些路徑會從不同預設路線中各截取一段,重新拼出新的走法,悄悄繞開模型原本設計的容量限制。結果就是,眼瞅著已經成立的反例,驗證完又塌了。GPT-5.6 Pro 在中途也總結得很坦白:只檢查幾百條預設路線遠遠不夠,一個真正有效的反例,必須把網路中所有可能出現的不可分流路線全部算進去。 這也讓整場人機合作顯得相當微妙。表面上看,Rybin 貢獻的只有 58 個單詞,但真正關鍵的動作,是他能夠判斷模型前三輪交出的都屬於階段性結果,並一次次拒絕提前收工。沃頓商學院教授 Ethan Mollick 看到後,甚至拋出了一個新問題:這項工作的作者,到底應該算寫下 58 個單詞的 Rybin,還是連續推演好幾個小時的 GPT-5.6 Pro?無論署名最後怎麼算,這段對話至少貢獻了一條相當樸素的 AI 使用經驗——催 AI 幹活最有用的提示詞,有時候真可以簡單到,只讓它繼續馬不停蹄地挖。過去一週,從雅可比猜想到 Dinitz-Garg-Goemans,AI 尋找數學反例的速度,確實已經開始顯得有點離譜了。
Related
相關文章

趨境科技華東區域總部落地錢江世紀城,五年內建成萬卡級高品質 AI Token 工廠
趨境科技與蕭山區錢江世紀城簽署協議,華東區域總部正式落地,計劃五年內建成萬卡級集群規模的高品質 AI Token 工廠。該公司源自清華大學計算機系,專注企業級AI推理解決方案,已在既有項目中實現日均高品質 AI Token 產量達萬億量級。

AI大模型進入「無限戰爭」
2026年7月17日凌晨,馬斯克在X平台簡短回應了一則關於Kimi K3的評測,只用了一個詞:「Impressive」。這款由月之暗面推出的新模型,參數規模達到2.8萬億,是當時全球最大的開源權重模型,在Artificial Analysis的智能指數中排名第三,僅次於Claude Fable 5和GPT-5.6 Sol。隔天,馬斯克又補了一句,說xAI正在訓練的2萬億參數模型「可能超過Kimi」。月之暗面則在微博上幽默回應:「歡迎加入『2萬億+』俱樂部」。

緊追 ChatGPT,谷歌 Gemini 應用已擁有 9.5 億月活躍用戶
谷歌Gemini AI應用月活躍用戶已達9.5億,緊追ChatGPT的10億用戶。過去一年日活躍用戶數成長三倍,用戶規模持續快速增長。谷歌同時推出速度更快、成本更低的新模型,以強化競爭力。

WAIC最狠展臺打爆工業「深水區」!它石智航首發具身原生大腦AWE 3.5,具身Scaling全面釋放
它石智航在WAIC發布具身原生基座模型AWE 3.5,能讓機器人無需切換參數即可執行多種工業任務,並在展會現場展示1:1還原的線束自動化產線。該模型從預訓練階段就整合視覺、語言與動作,成為首個完整打通預訓練到後訓練範式的原生模型,大幅降低新任務所需數據量,宣告具身Scaling全面釋放。

K3之後,Kimi為什麼急著上市?
月之暗面在發布2.8萬億參數的K3開源模型後,五天內接連宣布暫停新用戶註冊並啟動港股IPO計畫,顯示其急於在技術與商業化雙重拐點鎖定資本市場。Kimi的3億美元年度經常性收入(ARR)中API收入佔比逾七成,證明中國大模型靠API賺錢的模式可行,但300人團隊與算力瓶頸仍是上市後需面對的挑戰。

算力成生死線,巨頭瘋搶“超節點”
# 算力成生死线,巨头疯抢“超节点” 在刚刚落幕的世界人工智能大会(WAIC)上,一个原本屬於基礎設施層的概念——"超節點"(Super Node)意外成為全場焦點,風頭甚至蓋過了大模型本身。展館的中心位置被各類超節點產品佔據,華為、新華三、中興通訊、中科曙光等廠商紛紛亮出自家的旗艦方案,一場圍繞算力基礎設施的戰爭正在悄然升溫。 超節點,顧名思義,是指在物理上由多個計算節點(如AI加速卡、NPU或GPU)通過高效互聯協議緊密連接組成的計算系統,其核心特徵是具備"一臺計算機"的整體性能。