​小紅書大模型 IMO 滿分奪金:中國 AI 首次登頂數學奧賽,第三題解法讓冠軍選手直呼優雅

2026年7月22日 01:307100 次瀏覽

重點摘要

AI資訊AI新閒資訊正文​小紅書大模型 IMO 滿分奪金:中國 AI 首次登頂數學奧賽,第三題解法讓冠軍選手直呼優雅發布於AI新閒資訊時間 :Jul 22, 2026閱讀 :1分鐘第67屆國際數學奧林匹克競賽(IMO2026)成績近日揭曉,小紅書大模型 dots-note-3.0以六道題全部答對的滿分成績斬獲金牌。

站內 AI 整理稿

第67屆國際數學奧林匹克競賽(IMO 2026)近日揭曉成績,小紅書旗下基礎模型 dots-note-3.0 以六題全對、滿分 42 分的傑出表現奪得金牌。這是中國大模型首次取得 IMO 官方金牌水平認證,更超越去年谷歌 Gemini 答對 5/6 題的紀錄,成為全球首個在 IMO 上獲得滿分的大模型。這一成績不僅彰顯小紅書在 AI 推理領域的深厚積累,也為全球通用智慧研究寫下新篇章。IMO 是國際公認難度最高的中學生數學競賽,每年匯聚各國頂尖數學苗子,包含代數、組合、幾何與數論四個領域,每位選手必須在兩天共 9 小時內完成六道證明題,每題 7 分。

與一般測驗不同,IMO 要求參賽者產出邏輯完整、可逐步審查的證明過程,任何跳步或含糊解讀都會被評審指出,也因此成為衡量大模型真實推理能力的試金石。每屆賽題均由專家委員會秘密命製,外界無法提前取得,模型無法依靠記憶或資料汙染來應試,只能憑藉即時理解、邏輯探索與嚴密推導來解題。今年金牌線為 29 分,比去年下滑 6 分,顯示整套試題難度明顯提升;而在這道高門檻下,小紅書 dots-note-3.0 一舉拿到 42 分,整整高出金牌線 13 分,凸顯其穩定而全面的推理實力。回顧 AI 挑戰 IMO 的歷程,谷歌 Gemini 是先行者。

2024 年 Gemini 首次參賽時僅獲 28 分銀牌,且須將題目翻譯成 Lean 等形式化語言,部分題目耗時數日才能完成。2025 年升級版 Gemini Deep Think 改用自然語言端到端推理,終於在 4.5 小時內答對五題,拿下金牌。如今小紅書 dots-note-3.0 不僅在標準時間內完成全部六題,更以滿分超越對手,證明其推理系統從理解、探索到表達均達到頂尖水準。根據官方技術說明,dots-note-3.

0 採用智能體(Agent)架構,結合自然語言推理與 Python 程式碼執行來輔助計算,並引入遞迴自我批判(recursive self-critique)機制,在解題過程中反覆檢查自己的推論,確保每一步都符合邏輯。這種設計對於 IMO 這種需要嚴謹證明的場景特別關鍵,也解釋了為什麼模型能連續六關不失分。本次最令選手與教練驚豔的,是第三題的解法。第三題屬於組合博弈問題,常見標準策略是將原問題轉化為圖論連通性,再建構證明;但 dots-note-3.0 另闢蹊徑,採用歸納法直接抓住問題的數學本質,設計出恰到好處的歸納對象與命題。

雙 CMO(中國數學奧林匹克)金牌得主劉涵祚稱讚該解答「正確且漂亮,結構緊湊、邏輯自然,即使放在 IMO 解答中也屬於較為簡潔優雅的一類」。另一位 CMO 金牌得主汪千桐亦表示,該法「簡潔明瞭而且直擊本質,每一步都順理成章,但人類選手很難想到能從這個角度切入」。專家認證的背後,反映出新一代大模型不僅能產出正確答案,還有能力給出富有人類水準的優美證明——這對 AI 的可解釋性與信任度具有深遠意義。對小紅書而言,這次 IMO 滿分是一次戰略級技術亮相。過去外界對小紅書的技術印象多集中在內容推薦、社群演算法與多媒體處理,在基礎大模型領域缺少公開權威的實力證明。

如今 42 分擺在眼前,無需複雜解說,直接宣示小紅書已具備可與國際一線模型比肩的基礎能力,成為該賽道中不可忽視的新玩家。據悉,dots-note-3.0 將在近期對外開源,屆時學術界與開發者社群可深入分析其推理機制,甚至直接基於該模型進行二次開發與應用部署。這不僅有助於推動 AI 數學推理的後續研究,也將加速通用智慧在金融、科學發現、教育輔助等領域的落地。回望 IMO 2026,小紅書的滿分金牌代表的不只是一項技術記錄,更是一個訊號:AI 在抽象推理的疆域正以驚人速度擴展,從解題速度到解題品質,逐步逼近人類專家的頂標。當模型的推理能力足夠穩定、優雅且可複現,它便能承擔更高階的邏輯決策任務。

此次開源更意味著這項能力有機會被廣泛複製與迭代,催生更多意料之外的創新。總而言之,從谷歌 Gemini 到小紅書 dots-note-3.0,AI 在 IMO 賽場上的進步清楚顯示了大模型推理能力的躍升。數學競賽不再是只屬於人類天才的領地,AI 正以越來越成熟的姿態參與其中,不斷刷新我們對機器智慧的想像。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

14 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前