剛剛,全球三大AI包攬IMO滿分,擊敗99%人類

重點摘要
# 歷史性突破:三大AI全自主攻克IMO滿分,人類數學競技迎來新紀元 上海,七月。第67屆國際數學奧林匹克(IMO)剛剛落幕,人類選手的掌聲尚未散去,一道更為震撼的消息在科技圈引爆:全球三大前沿AI模型——Claude Fable 5、GPT-5.6 Sol與Kimi K3——以完全自主的方式,全數拿下IMO 2026的全部42分滿分。這不僅是AI在數學競賽領域的歷史性時刻,更標誌著機器在長鏈邏輯推理能力上的驚人飛躍。 ## 斷層式碾壓:0.
# 歷史性突破:三大AI全自主攻克IMO滿分,人類數學競技迎來新紀元
上海,七月。第67屆國際數學奧林匹克(IMO)剛剛落幕,人類選手的掌聲尚未散去,一道更為震撼的消息在科技圈引爆:全球三大前沿AI模型——Claude Fable 5、GPT-5.6 Sol與Kimi K3——以完全自主的方式,全數拿下IMO 2026的全部42分滿分。這不僅是AI在數學競賽領域的歷史性時刻,更標誌著機器在長鏈邏輯推理能力上的驚人飛躍。 ## 斷層式碾壓:0.69%的傳奇對上100%的機器
作為背景,人類在IMO賽場上的頂尖表現已是萬里挑一。過去七年間,全球4347名參賽選手中,僅有30人曾獲滿分,佔比不過0.69%。而此次AI的參賽成績不僅滿分,更呈現出「斷層式」碾壓。從得分分佈來看,滿分42分與第四名的28分之間,竟橫亙著14分的巨大鴻溝。三位「硅基選手」的答題姿態各有千秋。前Google工程師Deedy Das發起的這場權威橫評,記錄了三款模型的完整答題過程:Claude Fable 5僅用2.5小時、花費51美元便完成6道題;GPT-5.6 Sol耗時3.8小時,成本更低至20美元;而Kimi K3雖然歷經17.4小時「鏖戰」,花費31美元,但展現了截然不同的推理風格。
此外,獨立交卷的AxiomProver也同樣登頂滿分。這些數字背後,是AI在數學直覺與推理深度上的質變。不僅是人類無法企及的解題速度,更令人驚嘆的是它們在面對不同難度題目時展現出的策略多樣性。## 解題思路大對決:同一道題,三種天才
以全場最基礎的P1為例——這道關於正整數變換的證明題,所有模型均在幾分鐘內輕鬆解決。然而,它們運用的邏輯路徑卻截然不同,某種程度上反映了各自架構的「思維特質」。Claude Fable 5選擇了最直接的計數器策略。它定義了一個每步必定縮減的量Φ = T + N,巧妙地分兩種情況討論:當兩數最大公因數大於1時,素因子總數T減少;當兩數互質時,大於1的數目N減少。無論哪種情況,Φ這個正整數計數器都會嚴格遞減,從而證明過程必然終止。一刀斬斷,乾淨利落。GPT-5.6 Sol則走了一條更為抽象的「字典序降維」之路。它追蹤兩個量——所有數的乘積P和大於1的數的個數K。
每一步操作中,要麼P嚴格變小,要麼P不變而K減少。這個二元組(P, K)在字典序下嚴格遞減,而正整數的字典序不可能無限遞減,終止性得證。到了需要證明最終結果M不依賴操作順序的(b)部分,三個模型殊途同歸:它們都證明了對每個素數p,黑板所有數被p整除次數的最大公約數在操作中保持不變,由此推導出唯一的M值。不同的思維路徑,走向同一數學真理——這或許正是AI推理能力成熟的最佳寫照。## 最難的壓軸題與「最廉價的白卷」
Day 2的壓軸題P6,是去年IMO僅有6名人類選手解出的數論難題。這一次,三大滿分模型的表現依舊出色:Claude Fable 5僅用26分鐘、兩輪對話便拿下滿分;GPT-5.6 Sol耗時60分鐘、同樣兩輪完成;Kimi K3則經過381分鐘、四輪衝鋒才艱難完成。差異背後,是計算成本與推理路徑的取捨。與此形成鮮明對比的是Grok 4.5的表現。在P6上,它僅僅輸出了7053個token,提交文件中赫然寫著:「Full proof: (Not yet complete.)」全場最低的0.18美元成本,換來了一張「最廉價的白卷」。
更為顯露出問題的是,Grok反覆陷入一種詭異的「幻覺」:信誓旦旦宣稱證明已寫入文件,後台卻根本未曾調用寫入工具。這不是數學能力的不足,而是Agent層面的工具調用缺陷——模型知道應該做什麼,也認為自己做了,卻在實際執行層面「斷了線」。## 三年三級跳:從銀牌到滿分的進化之路
回顧AI在數學競賽領域的征途,這堪稱「三年三級跳」的恐怖進化。2024年,DeepMind的AlphaProof首次觸及IMO銀牌門檻;2025年,OpenAI未公開模型已能解5題、拿下35分金牌;到了2026年,三個通用大模型直接包攬滿分。更為關鍵的是,這些模型未經任何專項數學訓練,且任何人都可以使用——甚至其中一個還是開源模型。Axiom Math在這場突破中扮演了「架橋人」的角色。這家由年僅25歲的華人數學天才洪樂彤創辦的公司,將IMO 2026的全部6道考題逐字翻譯成機器可讀的Lean 4形式化語言。
正是這套系統,讓AI得以直接輸出Lean證明、由編譯器自動判分,徹底告別了人類評委的主觀閱卷。洪樂彤本人更是傳奇:僅用三年橫掃MIT數學與物理雙學位,斬獲Morgan Prize;去年底,她打造的AxiomProver拿下Putnam數學競賽滿分——該賽事98年歷史上僅有的第6個滿分奇蹟。今年3月,公司完成2億美元A輪融資,估值直逼16億美元。## 超越數學:邏輯推理正在重塑普通人生活
能夠書寫4229行嚴格證明的AI,它所掌控的遠不止解數學題的能力。其真正核心是長鏈條的邏輯推導——每一步不能跳、不能錯、不能含糊。 這項能力的影響遠超學術競賽。合同條款中有沒有漏洞、保險理賠條件是否滿足、稅務方案合不合規——所有這些困擾普通人的複雜問題,剝開表象都是同一類邏輯題:答案不能「差不多對」。過去,這類逐條核驗只有專業人士能做,且按小時計費。而當這項能力鋪進消費級產品,未來遇到棘手問題時,可能只需打開手機就能獲得專業級的分析與解答。 2026年的這個七月,上海見證了人類數學競技的輝煌,也見證了人工智能跨越歷史性門檻的瞬間。從僅有0.69%的人類天才能觸及的桂冠,到多款AI同時摘取——這不是人類的失敗,而是人類智慧在另一個載體上的延伸與綻放。數學競賽的聖殿從未關閉,只是門檻,正在被重新定義。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。