OpenAI連破10道數學難題,Fable 24小時「復現」5道

重點摘要
# OpenAI連破10道數學難題,Anthropic公開模型24小時「復現」5道|首發優勢急速縮水? 這個週末,AI圈被一場數學競賽點燃。OpenAI研究員Sébastien Bubeck拋出一枚重磅炸彈:其未公開的下一代主力模型Astra,一口氣證明了10項前沿數學成果。消息一出,輿論沸騰——有人驚呼「數學奇點已至」,也有人迫不及待等待更多細節。
# OpenAI連破10道數學難題,Anthropic公開模型24小時「復現」5道|首發優勢急速縮水? 這個週末,AI圈被一場數學競賽點燃。OpenAI研究員Sébastien Bubeck拋出一枚重磅炸彈:其未公開的下一代主力模型Astra,一口氣證明了10項前沿數學成果。消息一出,輿論沸騰——有人驚呼「數學奇點已至」,也有人迫不及待等待更多細節。然而更戲劇性的一幕發生在不到24小時後:Anthropic的研究員Levent Alpöge在Bubeck的帖子下淡定回應,稱其使用公開模型Fable,已經獨立復現了其中5項成果。 **審題:10道十年未解的硬骨頭**
先來看看OpenAI究竟做到了什麼。據Bubeck介紹,Astra證明的10項成果並非尋常習題。它們的主要結論在數學界至少10年沒有實質性進展,有些問題更是塵封數十年,屬於真正的開放性難題。這些問題雖然算不上數學王冠上最耀眼的明珠,卻個個都是公認的硬骨頭——不是靠小聰明或窮舉就能繞過的關隘。 Epoch AI旗下FrontierMath項目負責人Elliot Glazer給出了更直觀的評價:單論其中關於非索菲克群的研究成果,其分量足以進入數學界頂級期刊《數學年刊》(Annals of Mathematics)。換言之,這不是AI在填空題上的又一次表演,而是AI在無人區踩出了實實在在的腳印。 **Anthropic的「半壁江山」:24小時,5道題**
就在外界還在消化OpenAI的這一成就時,Anthropic研究員Levent Alpöge在Bubeck的帖子下發出一條簡短卻重磅的回覆:「我用Fable完成了一半。」隨後他補充說明,自己完成的是OpenAI榜單上的第4、5、6、7、8項,共計5項。Levent強調了實驗條件的乾淨:完全自主運行、使用通用提示詞、全程無網絡訪問。尤其值得注意的是,為了防止OpenAI的解法意外洩漏進上下文,他特意添加了一層防護機制。這意味著Fable的「復現」並非抄襲或模仿,而是在隔絕外部參考的情況下,獨立抵達了同一批結論。當然,嚴謹的數學驗證仍需時間。
截至目前,Levent尚未放出Fable的完整證明細節,但承諾會上傳相關文件。如果他所言屬實,這件事情的意義將發生質變:OpenAI用未發佈的模型Astra搶佔的首發優勢,只維持了24小時。而被追平的對手,是Anthropic早已公開、任何研究者都能調用的Fable。**一場「數學首發」的保鮮期,只剩一天**
有網友評論道:「公開可用的Fable,復現了Astra一半成果。」另一位用戶調侃:如此看來,OpenAI是不是只搶到了一個首發?過去,一項數學成果的優先權之爭,通常以年為單位——誰先想到、誰先證出、誰先發表,中間隔著漫長的投稿、審稿、修改週期。而今天,Astra尚未正式發布,其公佈的成果在24小時內就被公開模型追平了一半。 首發的含金量依然存在,但保質期已急劇縮短。這對AI研發機構而言,無疑是一個新的戰略信號:單靠「搶發」建立壁壘的時代,可能正在過去。如何持續產生新成果,如何讓模型在更具挑戰性的問題上保持領先,比單純的首發速度更加重要。 **2000美元背後:更貴的賬單與更殘酷的現實**
OpenAI還公佈了一個引人注目的數字:找到這10項解法的token成本,按API價格折算不到2000美元。研究員Noam Brown解釋說,這對應的是成功跑出10個解法的邊際推理成本,也就是最後臨門一腳的計算費用。但這2000美元遠非全部成本。在此之前,還有Astra本身的訓練研發,有那些嘗試過卻失敗的問題,有人類將論證整理成249頁論文的工時,有把每個證明形式化為Lean證書的工程投入,更有外部數學家後續審查的隱性成本。Noam也坦承,團隊還曾嘗試其他重大問題,但沒有成功,千禧年大獎難題一個也沒拿下。
即便如此,「2000美元解一道前沿難題」這一事實,仍然將AI驅動數學發現的邊際成本打到了地板。有人調侃:OpenAI是不是明天又要公佈10項新突破,或者下週直接一次發100項?這種低成本量產的潛力,正引發學界對研究成果供給方式的全新思考。**從「互相刷榜」到「互相驗貨」**
Fable去重做Astra的同一批題目,這件事的意義遠超普通的「刷榜」對決。傳統的刷榜測的是已知答案:題目和標準答案都擺在那裡,比較的是誰分數高。而兩個模型在無網絡、防洩漏的條件下,各自獨立抵達同一個前沿結論,測驗的是完全不同的維度——這個結果是否可靠?能否被獨立復現?這更像是一場真正的同行評審。值得注意的是,這並非Fable第一次展現獨立解決數學難題的能力。今年7月,Levent曾用Fable給出Jacobian猜想的三維反例,事後有人專門撰寫了一份7頁的代數驗證材料,確認那個顯式映射確實推翻了三維及更高維的猜想。這說明Fable並非只能「復現」他人成果,它同樣具備開拓新問題的實力。
網上有人質疑為何用Fable去做「追認」工作,而非直接解新題——實際上,Fable早已在做後者。**公眾的信任鏈與數學家的審慎**
這些數學成果究竟有多重要?對地球上絕大多數人來說,這不只是超出能力,更是超出理解範圍的命題。正如Ethan Mollick所說:我們只能相信專業數學家,相信他們告訴我們這究竟厲不厲害。代碼、圖片、聊天,普通人還能通過親身體驗來感知AI的能力;但非索菲克群的存在、Connes剛性猜想的反例、量子平行重複定理——這些概念只有極少數專家能真正看懂。AI的能力越往科學前沿推進,公眾所依賴的就越不是親身體驗,而是一條漫長的信任鏈。這種「連驚歎都無從驚歎」的狀態,正在越來越多的領域同步發生。
與此同時,數學家Thomas Bloom提醒我們:這些成果離不開上百年積累的數學理論,離不開數學家親手搭好的形式化系統。將它簡單描述為「AI取代了數學家」,並不誠實。他給出的評判標準是:這份證明,有沒有教給我們關於這個問題的新東西?**真正的瓶頸:驗證追得上生成嗎?**
這就指向了一個更深層的問題:當AI能以低成本、批量化的方式生產前沿數學證明,我們應該用什麼來衡量其成果的價值?答案或許不在產出端,而在驗收端——一份證明能否被讀懂、被核對、被判斷出分量,最終決定了它的真實價值。最稀缺的能力,正在從「做出證明」悄然轉向「看懂並驗收證明」。 當AI一夜之間就能給出十道難題的解法,真正的考驗才剛剛開始:證明越造越快,我們的驗證手段,還追得上嗎?這不僅是數學界要面對的問題,也是整個科學界乃至全社會即將共同遭遇的時代拷問。
Related
相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人
美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

一口氣發佈三款教育插件,OpenAI教育產品再升級
OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

騰訊、字節、阿里,搶著給打工人配「AI助理」
騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

推行AI提效後,策劃們開始加班趕工期
當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

DeepSeek大漲價,Token價格戰終於要結束了?
DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

狂攬130億!英偉達投的AI基建獨角獸又融資了
澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。