OpenAI連破10道數學難題,Fable 24小時「復現」5道

重點摘要
# OpenAI連破10道數學難題,Anthropic公開模型24小時「復現」5道|首發優勢急速縮水? 這個週末,AI圈被一場數學競賽點燃。OpenAI研究員Sébastien Bubeck拋出一枚重磅炸彈:其未公開的下一代主力模型Astra,一口氣證明了10項前沿數學成果。消息一出,輿論沸騰——有人驚呼「數學奇點已至」,也有人迫不及待等待更多細節。
# OpenAI連破10道數學難題,Anthropic公開模型24小時「復現」5道|首發優勢急速縮水? 這個週末,AI圈被一場數學競賽點燃。OpenAI研究員Sébastien Bubeck拋出一枚重磅炸彈:其未公開的下一代主力模型Astra,一口氣證明了10項前沿數學成果。消息一出,輿論沸騰——有人驚呼「數學奇點已至」,也有人迫不及待等待更多細節。然而更戲劇性的一幕發生在不到24小時後:Anthropic的研究員Levent Alpöge在Bubeck的帖子下淡定回應,稱其使用公開模型Fable,已經獨立復現了其中5項成果。 **審題:10道十年未解的硬骨頭**
先來看看OpenAI究竟做到了什麼。據Bubeck介紹,Astra證明的10項成果並非尋常習題。它們的主要結論在數學界至少10年沒有實質性進展,有些問題更是塵封數十年,屬於真正的開放性難題。這些問題雖然算不上數學王冠上最耀眼的明珠,卻個個都是公認的硬骨頭——不是靠小聰明或窮舉就能繞過的關隘。 Epoch AI旗下FrontierMath項目負責人Elliot Glazer給出了更直觀的評價:單論其中關於非索菲克群的研究成果,其分量足以進入數學界頂級期刊《數學年刊》(Annals of Mathematics)。換言之,這不是AI在填空題上的又一次表演,而是AI在無人區踩出了實實在在的腳印。 **Anthropic的「半壁江山」:24小時,5道題**
就在外界還在消化OpenAI的這一成就時,Anthropic研究員Levent Alpöge在Bubeck的帖子下發出一條簡短卻重磅的回覆:「我用Fable完成了一半。」隨後他補充說明,自己完成的是OpenAI榜單上的第4、5、6、7、8項,共計5項。 Levent強調了實驗條件的乾淨:完全自主運行、使用通用提示詞、全程無網絡訪問。尤其值得注意的是,為了防止OpenAI的解法意外洩漏進上下文,他特意添加了一層防護機制。這意味著Fable的「復現」並非抄襲或模仿,而是在隔絕外部參考的情況下,獨立抵達了同一批結論。 當然,嚴謹的數學驗證仍需時間。截至目前,Levent尚未放出Fable的完整證明細節,但承諾會上傳相關文件。如果他所言屬實,這件事情的意義將發生質變:OpenAI用未發佈的模型Astra搶佔的首發優勢,只維持了24小時。而被追平的對手,是Anthropic早已公開、任何研究者都能調用的Fable。 **一場「數學首發」的保鮮期,只剩一天**
有網友評論道:「公開可用的Fable,復現了Astra一半成果。」另一位用戶調侃:如此看來,OpenAI是不是只搶到了一個首發?過去,一項數學成果的優先權之爭,通常以年為單位——誰先想到、誰先證出、誰先發表,中間隔著漫長的投稿、審稿、修改週期。而今天,Astra尚未正式發布,其公佈的成果在24小時內就被公開模型追平了一半。 首發的含金量依然存在,但保質期已急劇縮短。這對AI研發機構而言,無疑是一個新的戰略信號:單靠「搶發」建立壁壘的時代,可能正在過去。如何持續產生新成果,如何讓模型在更具挑戰性的問題上保持領先,比單純的首發速度更加重要。 **2000美元背後:更貴的賬單與更殘酷的現實**
OpenAI還公佈了一個引人注目的數字:找到這10項解法的token成本,按API價格折算不到2000美元。研究員Noam Brown解釋說,這對應的是成功跑出10個解法的邊際推理成本,也就是最後臨門一腳的計算費用。 但這2000美元遠非全部成本。在此之前,還有Astra本身的訓練研發,有那些嘗試過卻失敗的問題,有人類將論證整理成249頁論文的工時,有把每個證明形式化為Lean證書的工程投入,更有外部數學家後續審查的隱性成本。Noam也坦承,團隊還曾嘗試其他重大問題,但沒有成功,千禧年大獎難題一個也沒拿下。 即便如此,「2000美元解一道前沿難題」這一事實,仍然將AI驅動數學發現的邊際成本打到了地板。有人調侃:OpenAI是不是明天又要公佈10項新突破,或者下週直接一次發100項?這種低成本量產的潛力,正引發學界對研究成果供給方式的全新思考。 **從「互相刷榜」到「互相驗貨」**
Fable去重做Astra的同一批題目,這件事的意義遠超普通的「刷榜」對決。傳統的刷榜測的是已知答案:題目和標準答案都擺在那裡,比較的是誰分數高。而兩個模型在無網絡、防洩漏的條件下,各自獨立抵達同一個前沿結論,測驗的是完全不同的維度——這個結果是否可靠?能否被獨立復現?這更像是一場真正的同行評審。 值得注意的是,這並非Fable第一次展現獨立解決數學難題的能力。今年7月,Levent曾用Fable給出Jacobian猜想的三維反例,事後有人專門撰寫了一份7頁的代數驗證材料,確認那個顯式映射確實推翻了三維及更高維的猜想。這說明Fable並非只能「復現」他人成果,它同樣具備開拓新問題的實力。網上有人質疑為何用Fable去做「追認」工作,而非直接解新題——實際上,Fable早已在做後者。 **公眾的信任鏈與數學家的審慎**
這些數學成果究竟有多重要?對地球上絕大多數人來說,這不只是超出能力,更是超出理解範圍的命題。正如Ethan Mollick所說:我們只能相信專業數學家,相信他們告訴我們這究竟厲不厲害。代碼、圖片、聊天,普通人還能通過親身體驗來感知AI的能力;但非索菲克群的存在、Connes剛性猜想的反例、量子平行重複定理——這些概念只有極少數專家能真正看懂。 AI的能力越往科學前沿推進,公眾所依賴的就越不是親身體驗,而是一條漫長的信任鏈。這種「連驚歎都無從驚歎」的狀態,正在越來越多的領域同步發生。與此同時,數學家Thomas Bloom提醒我們:這些成果離不開上百年積累的數學理論,離不開數學家親手搭好的形式化系統。將它簡單描述為「AI取代了數學家」,並不誠實。他給出的評判標準是:這份證明,有沒有教給我們關於這個問題的新東西? **真正的瓶頸:驗證追得上生成嗎?**
這就指向了一個更深層的問題:當AI能以低成本、批量化的方式生產前沿數學證明,我們應該用什麼來衡量其成果的價值?答案或許不在產出端,而在驗收端——一份證明能否被讀懂、被核對、被判斷出分量,最終決定了它的真實價值。最稀缺的能力,正在從「做出證明」悄然轉向「看懂並驗收證明」。 當AI一夜之間就能給出十道難題的解法,真正的考驗才剛剛開始:證明越造越快,我們的驗證手段,還追得上嗎?這不僅是數學界要面對的問題,也是整個科學界乃至全社會即將共同遭遇的時代拷問。
Related
相關文章
一句話掀起爭論!Anthropic CEO抱怨員工上班只為錢 沒有AI使命感
據知情人士透露,達裡奧·阿莫迪曾在內部表達擔憂:一些人更多是為了錢才加入Anthropic,而不是為了公司崇高的AI使命。幾小時內這句話傳遍全網,輿論一片譁然。有幾條比較經典的評論寫道:“突發新聞:人們為了錢工作”“本地男子發現了經濟規律”“他裝得好像自己是義務勞動,不求任何報酬似的”。
SpaceX發佈上市後首份財報:星鏈扛盈利 86%資本開支砸向AI
SpaceX發佈上市後首份財報,大眾熟知的星鏈是目前SpaceX最接近成熟的商業模式,也是目前最主要的利潤來源。星鏈業務收入同比增長66%,佔公司總營收的一半以上。

AI帶火挖掘機,土木狗有救了?
AI技術正逐步滲透傳統工程機械領域,其中挖掘機的智慧化升級成為近期討論焦點。過去被戲稱為「土木狗」的從業人員,如今可能因為人工智慧的導入而迎來工作型態的轉變。透過電腦視覺、深度學習與自動控制系統,新一代挖掘機能夠辨識工地環境、精準執行挖土與裝載任務,甚至可在無人操作下完成重複性作業,大幅降低人力需求與工安風險。

英偉達 Alpamayo 2 Super AI 開放商用:為自動駕駛汽車帶來 360° 感知、高級駕駛決策
英偉達(NVIDIA)於8月4日透過官方部落格宣布,正式推出面向自動駕駛領域的開源模型 Alpamayo 2 Super,即日起開放商業使用。這款模型具備開放商業授權與領先的多任務自動駕駛推理能力,目標是協助車輛在複雜路況中做出更安全、更即時的決策。 英偉達在博文中指出,自動駕駛汽車面臨的真正挑戰並非日常行駛,而是那些罕見、難以預測且高度複雜的場景。車輛不僅要能辨識物體、預測其他用路人的動向,還必須理解整體場景、推論因果關係,並在正確的時間選擇正確的駕駛動作,最終將這些決策轉化為安全且舒適的行駛路徑。
Anthropic鎖定鉅額雲算力
Anthropic鎖定鉅額雲算力。 頭部公司鎖定了鉅額雲算力。合作詳情見雲算力交易報道。算力合同 ��� 覆蓋了未來六年時間。設施將由先進的計算芯片進行支撐。全球算力競爭的激烈程度持續升溫。

Anthropic CEO擔心:招來的人只認錢不在乎使命,百萬年薪的反噬?
這篇消息聚焦「Anthropic CEO擔心:招來的人只認錢不在乎使命,百萬年薪的反噬?」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。