GPT-5.6僅用1小時攻破50年數學難題,64個AI摘下圖論皇冠

重點摘要
好的,這是一篇基於您提供的資料,重新組織並撰寫的完整新聞稿。 --- ### GPT-5.6僅用一小時攻破50年數學難題:64個AI「群聊」摘下圖論皇冠 就在全球還在熱議大模型「能力瓶頸」與「商業變現」時,一場足以改寫科學史的事件在7月11日凌晨悄然發生。OpenAI 官方對外宣佈,其最新一代模型 GPT-5.6 Sol Ultra 成功證明了困擾數學界長達半個世紀的「循環雙覆蓋猜想」(Cycle Double Cover Conjecture)。
好的,這是一篇基於您提供的資料,重新組織並撰寫的完整新聞稿。 ---
### GPT-5.6僅用一小時攻破50年數學難題:64個AI「群聊」摘下圖論皇冠
就在全球還在熱議大模型「能力瓶頸」與「商業變現」時,一場足以改寫科學史的事件在7月11日凌晨悄然發生。OpenAI 官方對外宣佈,其最新一代模型 GPT-5.6 Sol Ultra 成功證明了困擾數學界長達半個世紀的「循環雙覆蓋猜想」(Cycle Double Cover Conjecture)。更令學界震動的是,從破題到產出完整嚴謹的學術論文級證明,AI 只用了不到一個小時。 這項成就標誌著人工智慧在純粹的抽象邏輯推理領域,實現了對人類頂尖智力的全面超越。曾經被譽為圖論領域「皇冠級」難題的猜想,如同一座大山橫亙在全世界數學家的面前,如今卻被一群 AI 在極短的時間內迅速「踏平」。 #### 幽靈般盤旋半世紀的數學魔咒
循環雙覆蓋猜想,由圖論大師 Tutte 以及 Itai、Rodeh、Szekeres、Seymour 等傳奇數學家在上世紀各自獨立提出。它描述了一個極其簡潔而優雅的數學現象:對於任何一個不存在「橋」(即切斷就會讓圖不連通的邊)的有限無向圖,我們一定能找到一組環,使得圖中的每一條邊,都恰好被包含在恰好兩個環內。如果用城市交通來打比方,這個猜想相當於說,在一個沒有「死衚衕」和「唯一通道」的道路網絡中,一定可以設計出若干條「環狀公交線路」,使得城市裡的每一條道路都剛好有兩趟公交車經過,不多也不少。半個世紀以來,無數頂尖數學家為此傾注心血,但鮮有突破。
他們僅能在特定條件下證明該猜想是成立的,例如:Jaeger 證明了平面圖符合該猜想;Szekeres 證明了可進行 3 邊著色的立方圖符合該猜想;Alspach、Goddyn 和 Zhang 則證明了不含某種特定子圖的無橋圖也符合該猜想。然而,那個不含任何附加條件的、完整的、肯定的證明,就像數學幽靈一樣,讓所有人求而不得,直到 GPT-5.6 Sol Ultra 的出現。#### 不是一個AI在戰鬥:64個特工「開會」的降維打擊
OpenAI 是如何讓 AI 攻克這個世紀難題的?從他們公佈的任務提示詞與最終的證明文件中,我們得以一窺這個堪稱「團隊作戰」的驚人策略。在這個系統中,一個核心的 GPT-5.6 模型被分裂成 64 個併發運行的獨立智能體,它們並非各自為戰,而是組成一支真正的「科研特攻隊」。提示詞為這支隊伍設定了極其嚴苛的規則,幾乎是人類科研經驗的集大成。首先,系統嚴禁「千篇一律」的一窩蜂策略。在第一輪探索中,64個智能體被要求必須採取截然不同的研究路徑——有的從代數拓撲視角切入,有的嘗試結構歸納法,有的則採用流場表述、嵌入法甚至極端的參數化方法。
這種強制性的多元探索,極大避免了人類科研中常出現的「權威路徑依賴」。其次,系統設定了巧妙的「信息屏蔽」機制。它絕不會告訴大部分智能體「哪個方案目前最被看好」。因為在人類科研中,一旦某位大牛提出一個看似可行的方向,所有人都會蜂擁而至,從而扼殺其他可能性。最令人讚歎的是「糾察隊」機制的引入。64個智能體中,有一部分被專門設計成「槓精」角色。任何一個被提出的候選證明或推理步驟,都要被這些「糾察隊」用最苛刻的角度進行攻擊。它們會反覆質疑:「邊真的只被覆蓋了兩次嗎?」「你這個歸納法是不是不小心引入了隱藏的橋?」「這個結論是否過於依賴未經證明的假設?」
只有那些經過極限壓力測試,仍然邏輯嚴密、無懈可擊的證明,才有資格存活並進入下一輪。 此外,系統嚴禁「畫大餅」和「跳步」。它嚴厲警告所有智能體:拒絕「這一步顯然成立」這種敷衍的說法。每一個推導都必須給出具體的引理、構造、方程式甚至反例。遇到死衚衕必須立刻標記,除非提出全新的機制,否則絕不允許在無效路徑上浪費算力。 指令的最後,AI被明確要求:「在這上面至少花8個小時思考,然後再考慮放棄或返回結果。不要只給出局部結果,只有當找到完全肯定的證明並通過審核時,才能停止。」然而,這群由AI組成的特攻隊以驚人的效率提前完成了任務——他們只用了不到一小時,便帶著一份完美無瑕的數學證明凱旋而歸。 #### 一小時奇蹟:AI如何降維打敗圖論
打開那份名為《循環雙覆蓋猜想的證明》的文件,AI令人拍案叫絕的推理路徑清晰浮現。整篇論文由 GPT-5.6 Sol Ultra 自主生成,並在 Codex 的輔助下完成排版,其策略堪稱一場精妙的「降維手術」。第一步是化繁為簡。AI特攻隊首先確認了前人Jaeger的結論:只要證明了「無環立方圖」成立,就能通過拓撲變換推廣到所有圖。這一步將問題的複雜度大幅降低,鎖定了攻擊目標。第二步是引入神奇的「8-流定理」。這是全文最驚豔的洞察之一。AI翻出了圖論大師 Tutte 的「群流定理」(Group-flow theorem)。
藉助前人早已證明的「無橋圖存在處處非零的8-流」這一結論,AI將圖上的每一條邊,都賦予了由8個元素組成的三維空間向量(有限域 )中的非零標籤。這個標籤的妙處在於,在圖中的任意一個頂點(路口),所有流入和流出的向量之和必定為零,這為後續的證明提供了完美的代數基礎。第三步是構建「雙元素集」標籤法。AI提出了一個關鍵引理(Lemma 2.1):如果能給每一條邊分配一個包含兩個元素的集合,並且滿足在每一個頂點,任何一個元素要麼出現0次,要麼出現2次——那麼,這個圖就一定能實現「循環雙覆蓋」。這就像給每條道路發兩塊特殊的車牌,只要確保每個十字路口,相同顏色車牌的進出總是成對出現,證明就成功了一大半。
最後一步是終極絕殺。如何證明一定能找到這樣的「兩塊車牌」?AI展示了它作為機器最強悍的一面——將拓撲圖論問題,硬生生轉化成了一個巨大的線性代數方程組。它設定了變量,並構建了對偶向量空間,利用線性映射的像域與零空間的關係,進行了一段無懈可擊的代數推導。當所有方程式被劃上句號,最後推導出在有限域中結果永遠為零時,證明徹底終結了。人類苦苦尋找了50年的那把鑰匙,就這樣被64個AI智能體在極速的窮舉與交叉驗證中,硬生生鍛造了出來!#### 解題秘訣:「測試時計算」與人類的震撼
消息一出,整個AI圈和學術界為之沸騰。OpenAI 的推理研究科學家 Noam Brown 難掩激動,他連發數條推文揭示了這次突破背後的底層邏輯——並行測試時計算(TTC, Test-Time Compute)。 Noam Brown 指出:「增加模型的TTC(讓它思考更長時間)能帶來更高的智能。但如果我們把思考時間從幾秒鐘拉長到幾周,延遲就會成為巨大的瓶頸。GPT-5.6 Sol Ultra 的強大之處,在於它擴大了並行的TTC。解決一個50年曆史的難題,原本可能需要一整天,現在被壓縮到了區區一個小時。」
Ethan Knight 也宣佈:「我們今天正式全面開放GPT-5.6 Sol Ultra。看到它在不到一小時內,用64個子智能體證明了50年的CDC猜想,我們感到無比興奮!」
網友的反應同樣兩極分化。有人驚呼「並行推理將重新定義計算可能性的邊界!」,認為並行的TTC讓長時間運行的推理變得具有現實可用性。也有人感到細思極恐:「並行TTC加上算力的爆炸,再配合算法進步,事情開始變得有點嚇人了……」
當然,也有冷靜的質疑聲。有網友提出深刻問題:「並行TTC確實厲害,但沒有說出口的關鍵點是:64個獨立搜索的質量,能否等同於一個漫長而連續的單線深度推理邏輯鏈?廣度和深度並不能總是互換。」
儘管如此,能在一小時內自主完成從問題拆解、模型構建、邏輯推導到輸出嚴謹學術論文的全過程,這無疑證明了AI在高難度抽象邏輯推理領域已經達到了一個全新的高度。今天,64個智能體花1小時能解決50年的圖論猜想。明天,如果投入64萬個智能體,花上一個月的時間,或許就能攻克常溫超導、可控核聚變乃至癌症的奧秘。 我們距離通用人工智慧(AGI)甚至超級智慧(ASI),似乎又近了一大步。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。