剛剛,全球三大AI包攬IMO滿分,擊敗99%人類

2026年7月23日 08:04
剛剛,全球三大AI包攬IMO滿分,擊敗99%人類

重點摘要

# 歷史性突破:三大AI全自主攻克IMO滿分,人類數學競技迎來新紀元 上海,七月。第67屆國際數學奧林匹克(IMO)剛剛落幕,人類選手的掌聲尚未散去,一道更為震撼的消息在科技圈引爆:全球三大前沿AI模型——Claude Fable 5、GPT-5.6 Sol與Kimi K3——以完全自主的方式,全數拿下IMO 2026的全部42分滿分。這不僅是AI在數學競賽領域的歷史性時刻,更標誌著機器在長鏈邏輯推理能力上的驚人飛躍。 ## 斷層式碾壓:0.

站內 AI 整理稿

# 歷史性突破:三大AI全自主攻克IMO滿分,人類數學競技迎來新紀元

上海,七月。第67屆國際數學奧林匹克(IMO)剛剛落幕,人類選手的掌聲尚未散去,一道更為震撼的消息在科技圈引爆:全球三大前沿AI模型——Claude Fable 5、GPT-5.6 Sol與Kimi K3——以完全自主的方式,全數拿下IMO 2026的全部42分滿分。這不僅是AI在數學競賽領域的歷史性時刻,更標誌著機器在長鏈邏輯推理能力上的驚人飛躍。 ## 斷層式碾壓:0.69%的傳奇對上100%的機器

作為背景,人類在IMO賽場上的頂尖表現已是萬里挑一。過去七年間,全球4347名參賽選手中,僅有30人曾獲滿分,佔比不過0.69%。而此次AI的參賽成績不僅滿分,更呈現出「斷層式」碾壓。從得分分佈來看,滿分42分與第四名的28分之間,竟橫亙著14分的巨大鴻溝。 三位「硅基選手」的答題姿態各有千秋。前Google工程師Deedy Das發起的這場權威橫評,記錄了三款模型的完整答題過程:Claude Fable 5僅用2.5小時、花費51美元便完成6道題;GPT-5.6 Sol耗時3.8小時,成本更低至20美元;而Kimi K3雖然歷經17.4小時「鏖戰」,花費31美元,但展現了截然不同的推理風格。此外,獨立交卷的AxiomProver也同樣登頂滿分。 這些數字背後,是AI在數學直覺與推理深度上的質變。不僅是人類無法企及的解題速度,更令人驚嘆的是它們在面對不同難度題目時展現出的策略多樣性。 ## 解題思路大對決:同一道題,三種天才

以全場最基礎的P1為例——這道關於正整數變換的證明題,所有模型均在幾分鐘內輕鬆解決。然而,它們運用的邏輯路徑卻截然不同,某種程度上反映了各自架構的「思維特質」。 Claude Fable 5選擇了最直接的計數器策略。它定義了一個每步必定縮減的量Φ = T + N,巧妙地分兩種情況討論:當兩數最大公因數大於1時,素因子總數T減少;當兩數互質時,大於1的數目N減少。無論哪種情況,Φ這個正整數計數器都會嚴格遞減,從而證明過程必然終止。一刀斬斷,乾淨利落。 GPT-5.6 Sol則走了一條更為抽象的「字典序降維」之路。它追蹤兩個量——所有數的乘積P和大於1的數的個數K。每一步操作中,要麼P嚴格變小,要麼P不變而K減少。這個二元組(P, K)在字典序下嚴格遞減,而正整數的字典序不可能無限遞減,終止性得證。 到了需要證明最終結果M不依賴操作順序的(b)部分,三個模型殊途同歸:它們都證明了對每個素數p,黑板所有數被p整除次數的最大公約數在操作中保持不變,由此推導出唯一的M值。不同的思維路徑,走向同一數學真理——這或許正是AI推理能力成熟的最佳寫照。 ## 最難的壓軸題與「最廉價的白卷」

Day 2的壓軸題P6,是去年IMO僅有6名人類選手解出的數論難題。這一次,三大滿分模型的表現依舊出色:Claude Fable 5僅用26分鐘、兩輪對話便拿下滿分;GPT-5.6 Sol耗時60分鐘、同樣兩輪完成;Kimi K3則經過381分鐘、四輪衝鋒才艱難完成。差異背後,是計算成本與推理路徑的取捨。 與此形成鮮明對比的是Grok 4.5的表現。在P6上,它僅僅輸出了7053個token,提交文件中赫然寫著:「Full proof: (Not yet complete.)」全場最低的0.18美元成本,換來了一張「最廉價的白卷」。更為顯露出問題的是,Grok反覆陷入一種詭異的「幻覺」:信誓旦旦宣稱證明已寫入文件,後台卻根本未曾調用寫入工具。這不是數學能力的不足,而是Agent層面的工具調用缺陷——模型知道應該做什麼,也認為自己做了,卻在實際執行層面「斷了線」。 ## 三年三級跳:從銀牌到滿分的進化之路

回顧AI在數學競賽領域的征途,這堪稱「三年三級跳」的恐怖進化。2024年,DeepMind的AlphaProof首次觸及IMO銀牌門檻;2025年,OpenAI未公開模型已能解5題、拿下35分金牌;到了2026年,三個通用大模型直接包攬滿分。更為關鍵的是,這些模型未經任何專項數學訓練,且任何人都可以使用——甚至其中一個還是開源模型。 Axiom Math在這場突破中扮演了「架橋人」的角色。這家由年僅25歲的華人數學天才洪樂彤創辦的公司,將IMO 2026的全部6道考題逐字翻譯成機器可讀的Lean 4形式化語言。正是這套系統,讓AI得以直接輸出Lean證明、由編譯器自動判分,徹底告別了人類評委的主觀閱卷。洪樂彤本人更是傳奇:僅用三年橫掃MIT數學與物理雙學位,斬獲Morgan Prize;去年底,她打造的AxiomProver拿下Putnam數學競賽滿分——該賽事98年歷史上僅有的第6個滿分奇蹟。今年3月,公司完成2億美元A輪融資,估值直逼16億美元。 ## 超越數學:邏輯推理正在重塑普通人生活

能夠書寫4229行嚴格證明的AI,它所掌控的遠不止解數學題的能力。其真正核心是長鏈條的邏輯推導——每一步不能跳、不能錯、不能含糊。 這項能力的影響遠超學術競賽。合同條款中有沒有漏洞、保險理賠條件是否滿足、稅務方案合不合規——所有這些困擾普通人的複雜問題,剝開表象都是同一類邏輯題:答案不能「差不多對」。過去,這類逐條核驗只有專業人士能做,且按小時計費。而當這項能力鋪進消費級產品,未來遇到棘手問題時,可能只需打開手機就能獲得專業級的分析與解答。 2026年的這個七月,上海見證了人類數學競技的輝煌,也見證了人工智能跨越歷史性門檻的瞬間。從僅有0.69%的人類天才能觸及的桂冠,到多款AI同時摘取——這不是人類的失敗,而是人類智慧在另一個載體上的延伸與綻放。數學競賽的聖殿從未關閉,只是門檻,正在被重新定義。

Related

相關文章

量子位生成式AI

科大訊飛發佈星火Token Factory,打造企業級AI模型智能路由與治理新底座

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 科大訊飛發佈星火Token Factory,打造企業級AI模型智能路由與治理新底座 量子位的朋友們 2026-07-23 09:55:14 來源:量子位 AI產業澎湃,越來越多企業開始將人工智能深度融入研發、生產、客服、營銷等核心業務場景。在大模型應用規模快速增長的同時,企業也面臨新的挑戰:模型種類不斷增加、調用成本持續攀升、系統穩定性要求不斷提高,而跨模型管理、成本控制、安全治理和運行監控等能力建設卻相對滯後。 面對企業AI規模化落地過程中普遍存在的運營管理難題,科大訊飛7月19日正式推出星火Token Factory,通過統一接入、智能路由、全鏈路治理與成本優化能力,為企業構建面向未來的大模型基礎設施底座。 聚焦企業AI規模化落地挑戰 當前,大模型應用正從單點試點走向多業務、多場景、多團隊協同應用的新階段。 企業往往需要同時接入多個模型服務,支撐代碼助手、智能客服、知識問答、內容生成、文檔處理等不同業務場景。隨著調用規模增長,企業面臨的管理壓力也在持續加大。 一方面,不同任務複雜度差異顯著,但實際應用中往往採用統一模型處理,導致資源利用效率不高,Token成本持續增長;另一方面,多模型並行運行也對系統穩定性、安全治理以及運營管理提出更高要求。 與此同時,企業AI建設正逐步從“模型能力建設”邁向“AI基礎設施建設”階段。企業關注的重點,不再僅僅是模型本身能力是否足夠強大,而是如何讓模型能力真正融入業務體系,實現穩定運行、統一治理和持續優化。如何在保障業務效果的同時降低成本、提升穩定性、實現統一管理,正在成為企業推進AI規模化應用的重要課題。 星火

剛剛

AI幻覺最可怕的人類副作用出現了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作AI幻覺最可怕的人類副作用出現了量子位·2026年07月23日 10:03GPT、Claude、Gemini都沒逃過“翻車”。 最新研究發現,AI幻覺不只會騙你了,還能喂大你的自信心、削弱你的判斷力。 這可不妙。 最近,一項來自巴黎高師、羅馬第一大學、米蘭比可卡大學的研究發現: 沒有AI時,人們會更爽快地承認“我不知道”,先把判斷放一放; 但AI一齣現,哪怕人們明明知道它會犯錯,哪怕知道答錯還要受罰,大部分人還是會選擇把它給出的答案照單全收,當成是自己的判斷並自信地說出口。 實驗結果也清晰地呈現了這一趨勢:在首個未使用AI的實驗中,坦言“我不知道”的人數佔比為44%,正確率為27%; 而使用AI輔助後,人們說不知道的比例從44%驟降至了3%,正確率從27%跌至了9%,自信心卻從30%飆到了76%。 即便後續實驗試圖通過“答對給錢、答錯罰錢”這種獎懲機制鼓勵大家保持獨立判斷,並糾正這一傾向,但人們仍然難以擺脫對AI錯誤建議的依賴。 也就是說,不懂的人並未真正消失,取而代之的是一群在AI的加持下變得自信滿滿,並給出錯誤答案的人。 目前,相關研究成果已發表在arxiv上,團隊一共做了5個實驗,參與者總數達3132人,其中

剛剛

AI 瀏覽器,要換一種活法了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作AI 瀏覽器,要換一種活法了科技狐·2026年07月23日 10:02未來要消失的,也許不是瀏覽器,而是“瀏覽網頁”這件事本身 大夥兒想過沒,在 AI 時代,你是否需要一個獨立原生的 AI 瀏覽器? 對此很多互聯網巨頭做過探索,比如 OpenAI 推出了 Atlas 瀏覽器,把 ChatGPT 的功能融入了瀏覽器的使用流程;美團推出了 Tabbit 瀏覽器,核心理念是用 Agent 幫助用戶幹活。 夸克、QQ 這兩家瀏覽器是另一種思路,瀏覽器基本功能不變,將 AI 對話和搜索融合起來,瀏覽器成為自己 AI 大模型的入口。 桌面互聯網發展這麼多年,瀏覽器依然是一個穩定的流量入口,同樣也是互聯網巨頭們的兵家必爭之地。 但隨著 GPT-5.6 的發佈,OpenAI 攤牌了,決定不爭了。 他們對產品線做出了重大調整,把 Altas 瀏覽器項目取消,把 Codex 桌面端也取消,全部併入了 ChatGPT 這個桌面應用裡。 是 Altas 瀏覽器不香了嗎? 可能大家夥兒都沒有用過 Atlas 瀏覽器,簡單來說,這是一款將 ChatGPT 作為核心功能的瀏覽器,是 OpenAI 對“AI 原生瀏覽器”的一次嘗試。 Atlas

剛剛
鈦媒體生成式AI

Kimi K3 時刻:中美 AI 產業鏈敘事要變天?

Kimi K3 時刻:中美 AI 產業鏈敘事要變天?海豚研究2026.07.23 09:50 · 來自浙江全文7190字00:00 / 19:38當大模型競爭開始蔓延到頭部。文 | 海豚研究上週全球市場直接把大家跌懵了,真假小作文趁機甚囂塵上。

剛剛

36氪首發 | 前華爾街投資人下場造“手”,以“自研視觸覺+軟硬閉環”破解行業數據難題

前华尔街投资人创办拾玥科技,以自研视触觉和软硬闭环突破灵巧手数据瓶颈 近日,机器人灵巧操作方案提供商拾玥科技(LumiBot)宣布完成数千万元天使轮融资。本轮融资由常州智融长优股权投资合伙企业(有限合伙)(常友科技旗下基金)领投,另有两家国有投资平台旗下基金跟投。资金将主要用于团队扩张、产品迭代与小批量产线建设,以及灵巧操作数据采集与模型研发。拾玥科技成立于2025年初,专注于为工业制造、精密装配等高精度场景提供灵巧操作解决方案。

剛剛