AI數學的最後一道高牆,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

T-6 Astra攻破了。至此,這套曾經被視作大模型數學噩夢的研究級測試,所有題目都已經至少被AI成功解出過一次。Epoch AI也正式給它下了結論,FrontierMath Tier 4,飽和了。雖然從上面的圖裡看,Astra還沒有直接幹到100%,OpenAI自己公佈的成績也是97.6%。但按照Epoch的算法,“全部解出”指的是把不同模型、不同時間的嘗試累積起來以後,Tier 4裡的每一道題都已經有過成功解答。而Astra幹掉的,正是此前唯一還沒有被AI攻破的那一道。(簡單理解就是Astra可能在某次測試中出錯了,但它對的那道題是此前沒被解出來的) 有一說一,這個發展速度還是相當離譜的。
如果你關注模型評測的話,就知道2025年7月11日,Tier 4剛剛推出時,榜上最高成績只有大約5%。現在剛過了一年零2個月,這個曾經的“高牆”已經變成了“臺階”,最後一道難以被AI通過捷徑繞道解決的問題也被跨越。出題人自馬凱特大學數學副教授Jay Pantone也表示,以往AI都會找數值捷徑,而這一次,AI的解法和自己相當接近。不過,就在最近GPT-6 Astra集中向數學界猛攻,三天兩頭解決千禧年難題之際,Pantone表示自己已經很難驚訝了!可以說,數學儼然已經成了Astra最近刷存在感最猛的地方之一。
從不足2%,到專門加一道“研究級防線” FrontierMath最早於2024年11月7日發佈,而它誕生的目的,本身就是為了避免數學Benchmark過快被AI刷穿。當時像GSM8K、MATH這樣的傳統數學Benchmark已經越來越難拉開頭部模型之間的差距,於是Epoch AI聯合60多位數學家,重新設計了一批此前從未公開過的原創題。其中,就包括陶哲軒、Timothy Gowers、Richard Borcherds等菲爾茲獎得主。陶哲軒當時看完其中一些研究級題目後直言,這些題“極其困難”,甚至判斷最難的Tier 3,可能還能讓AI再卡上幾年。
結果第一輪測下來,果然不出所料,領先模型的正確率還不到2%。具體的,在最開始,FrontierMath的核心題庫共有300道題,按照難度分成Tier 1、Tier 2和Tier 3三個層級。Tier 1大致接近高難度本科題和數學奧賽,不過允許使用更高級的工具;Tier 2已經來到高年級研究生難度;Tier 3則更接近博士生早期會遇到的探索性研究問題。但隨著推理模型出現,這前三層也開始越來越不夠用了,於是2025年,Epoch又往上加了一層,Tier 4。Tier 4大多由數學教授和博士後設計,每個人會圍繞自己的研究方向,進行數週左右的短期研究,最後再把成果壓縮成一道可以被自動驗證的問題。
最初,Tier 4一共收錄了50道題。它們覆蓋的範圍包括分析、數論、組合數學、拓撲、代數幾何…… 在發佈之初,所有模型歷次測試加起來,也只有3道題曾經被解出,而且這些解答還依賴了一些正確、但沒有被充分論證的假設。鑑於此,在官網的公開樣題頁面上,Epoch還一度寫道:其中一些題,可能幾十年都不會被AI解決。(這句話現在開始被反覆鞭屍) 不過隨著模型越來越強,另一個問題也暴露了出來:題庫本身也開始經不起AI“拷打”了。OpenAI在測試過程中發現,FrontierMath裡的錯誤比預期更多。隨後Epoch啟動獨立審計,先用GPT-5.5和Claude Opus 4.
7篩查疑點,再交給數學家逐題複核。最終在2026年6月推出v2版本,其中Tier 4修正了12道題、移除了7道題,留下43題。修訂之後,模型的成績依然一路往上衝。GPT-5.6 Sol做到83.0%,Claude Fable 5達到90.2%,到了GPT-6 Astra,成績已經來到97.6%。更關鍵的是,Astra還補上了此前唯一一道從未被AI解出的題。至此,Tier 4裡的每一道題,都已經至少被AI成功攻破過一次。這套專門為最強模型加出來的研究級防線,最終也被刷穿了。不過,這並不意味著“數學已經被AI解決了”。恰恰相反,FrontierMath自己已經開始往下一階段走。
現在整個項目除了Tiers 1-4,還增加了真正的Open Problems,以及把Erdős開放問題形式化進Lean的FrontierMath Erdős。前者直接拿尚未被數學界解決的研究問題考模型;後者則要求AI寫出能夠通過形式化驗證的完整證明。這一次,Astra在FrontierMath Erdős的68道問題裡,只解決了2道。故事仍在繼續~ 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。