小紅書大模型 IMO 滿分奪金:中國 AI 首次登頂數學奧賽,第三題解法讓冠軍選手直呼優雅
重點摘要
AI資訊AI新閒資訊正文小紅書大模型 IMO 滿分奪金:中國 AI 首次登頂數學奧賽,第三題解法讓冠軍選手直呼優雅發布於AI新閒資訊時間 :Jul 22, 2026閱讀 :1分鐘第67屆國際數學奧林匹克競賽(IMO2026)成績近日揭曉,小紅書大模型 dots-note-3.0以六道題全部答對的滿分成績斬獲金牌。
第67屆國際數學奧林匹克競賽(IMO 2026)近日揭曉成績,小紅書旗下基礎模型 dots-note-3.0 以六題全對、滿分 42 分的傑出表現奪得金牌。這是中國大模型首次取得 IMO 官方金牌水平認證,更超越去年谷歌 Gemini 答對 5/6 題的紀錄,成為全球首個在 IMO 上獲得滿分的大模型。這一成績不僅彰顯小紅書在 AI 推理領域的深厚積累,也為全球通用智慧研究寫下新篇章。 IMO 是國際公認難度最高的中學生數學競賽,每年匯聚各國頂尖數學苗子,包含代數、組合、幾何與數論四個領域,每位選手必須在兩天共 9 小時內完成六道證明題,每題 7 分。與一般測驗不同,IMO 要求參賽者產出邏輯完整、可逐步審查的證明過程,任何跳步或含糊解讀都會被評審指出,也因此成為衡量大模型真實推理能力的試金石。 每屆賽題均由專家委員會秘密命製,外界無法提前取得,模型無法依靠記憶或資料汙染來應試,只能憑藉即時理解、邏輯探索與嚴密推導來解題。今年金牌線為 29 分,比去年下滑 6 分,顯示整套試題難度明顯提升;而在這道高門檻下,小紅書 dots-note-3.0 一舉拿到 42 分,整整高出金牌線 13 分,凸顯其穩定而全面的推理實力。 回顧 AI 挑戰 IMO 的歷程,谷歌 Gemini 是先行者。2024 年 Gemini 首次參賽時僅獲 28 分銀牌,且須將題目翻譯成 Lean 等形式化語言,部分題目耗時數日才能完成。2025 年升級版 Gemini Deep Think 改用自然語言端到端推理,終於在 4.5 小時內答對五題,拿下金牌。如今小紅書 dots-note-3.0 不僅在標準時間內完成全部六題,更以滿分超越對手,證明其推理系統從理解、探索到表達均達到頂尖水準。 根據官方技術說明,dots-note-3.0 採用智能體(Agent)架構,結合自然語言推理與 Python 程式碼執行來輔助計算,並引入遞迴自我批判(recursive self-critique)機制,在解題過程中反覆檢查自己的推論,確保每一步都符合邏輯。這種設計對於 IMO 這種需要嚴謹證明的場景特別關鍵,也解釋了為什麼模型能連續六關不失分。 本次最令選手與教練驚豔的,是第三題的解法。第三題屬於組合博弈問題,常見標準策略是將原問題轉化為圖論連通性,再建構證明;但 dots-note-3.0 另闢蹊徑,採用歸納法直接抓住問題的數學本質,設計出恰到好處的歸納對象與命題。雙 CMO(中國數學奧林匹克)金牌得主劉涵祚稱讚該解答「正確且漂亮,結構緊湊、邏輯自然,即使放在 IMO 解答中也屬於較為簡潔優雅的一類」。 另一位 CMO 金牌得主汪千桐亦表示,該法「簡潔明瞭而且直擊本質,每一步都順理成章,但人類選手很難想到能從這個角度切入」。專家認證的背後,反映出新一代大模型不僅能產出正確答案,還有能力給出富有人類水準的優美證明——這對 AI 的可解釋性與信任度具有深遠意義。 對小紅書而言,這次 IMO 滿分是一次戰略級技術亮相。過去外界對小紅書的技術印象多集中在內容推薦、社群演算法與多媒體處理,在基礎大模型領域缺少公開權威的實力證明。如今 42 分擺在眼前,無需複雜解說,直接宣示小紅書已具備可與國際一線模型比肩的基礎能力,成為該賽道中不可忽視的新玩家。 據悉,dots-note-3.0 將在近期對外開源,屆時學術界與開發者社群可深入分析其推理機制,甚至直接基於該模型進行二次開發與應用部署。這不僅有助於推動 AI 數學推理的後續研究,也將加速通用智慧在金融、科學發現、教育輔助等領域的落地。 回望 IMO 2026,小紅書的滿分金牌代表的不只是一項技術記錄,更是一個訊號:AI 在抽象推理的疆域正以驚人速度擴展,從解題速度到解題品質,逐步逼近人類專家的頂標。當模型的推理能力足夠穩定、優雅且可複現,它便能承擔更高階的邏輯決策任務。此次開源更意味著這項能力有機會被廣泛複製與迭代,催生更多意料之外的創新。 總而言之,從谷歌 Gemini 到小紅書 dots-note-3.0,AI 在 IMO 賽場上的進步清楚顯示了大模型推理能力的躍升。數學競賽不再是只屬於人類天才的領地,AI 正以越來越成熟的姿態參與其中,不斷刷新我們對機器智慧的想像。
Related
相關文章

天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角”
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角” 量子位的朋友們 2026-07-22 11:54:49 來源:量子位 從答題響應到心智仿真 當下教育數字化已走完信息化、數字化兩大階段,但教育仍深陷質量、成本、規模難以兼顧的“不可能三角”:傳統自適應工具、通用大模型僅停留在內容分發表層,只能完成答題響應、習題推薦,無法仿真學習者內在認知邏輯,難以破解統一教學與異質認知的核心矛盾,行業亟待從“信息傳遞”邁向“認知仿真”。 7月18日,在2026第9屆世界人工智能大會(WAIC)未來計算與未來算力論壇上,天立國際、啟鳴達人、天立啟鳴AI研究院、AIII人工智能國際研究院,以及北京航空航天大學國際創新研究院聯合打造併發布了《世界模型驅動的教育AGI白皮書——從認知仿真到教育智能體的範式躍遷》(以下簡稱:《白皮書》)。 天立國際首席科學家、啟鳴達人公司CTO、天立啟鳴AI研究院院長、北京航空航天大學國際創新研究院基礎教育通用人工智能實驗室首席科學家兼聯合主任劉志毅在論壇上對《白皮書》做了詳細解讀。 《白皮書》以認知世界模型(CWM)為底座、以LAM(Learning Assessment-Modeling)閉環為範式,提出教育仿真器—規劃器—渲染器為三位一體的工程架構。並將”湧現式教育”(Emergent Education)確立為未來願景、”認知共生”(Cognitive Symbiosis)確立為人機關係主張,為政策制定者、教育從業者、技術開發者與學術研究者提供下一代智能教育基礎設施的理論錨點與落地指南。 值得一提的是,白皮書的技術主張並非停留在紙

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?
大廠AI入口大戰升級,誰是最能幹活的桌面Agent?劃重點KeyPoints2026.07.22 11:57 · 來自浙江全文4694字00:00 / 13:42實測騰訊WorkBuddy、字節豆包專業版、百度搭子、阿里QoderWork文 | 劃重點KeyPoints,作者|心怡,編輯|重點君互聯網大廠間的AI入口大戰打到了桌面端。先說一條剛出爐的消息。據《財經》7月21日報道,阿里即將推出千問辦公,把QoderWork、悟空、MuleRun三款Agent產品合併成,交給釘釘新任CEO陳宇森負責。不止阿里,騰訊也正把資源集中到WorkBuddy上,字節內部討論把飛書和豆包辦公深度整合。信號很明確,持續半年的大廠Agent“賽馬”結束,C端的入口大戰剛歇,各家開始把資源集中到新戰場:桌面Agent的入口大戰升級了。目前戰況如何?數據顯示,WorkBuddy今年7月DAU已突破1300萬,是國內用戶活躍度最高的Agent辦公產品。再看一組訪問量數據,從六月桌面AI原生辦公智能體的訪問量看,騰訊WorkBuddy、阿里QoderWork排在第一梯隊。四位選手各有來頭。WorkBuddy產品底座沿用打磨兩年多的CodeBuddy內核,馬化騰在財報會上直接稱它是“中國使用最廣的效率智能體服務”。豆包專業版背靠字節自家的Seedream、Seedance,是四家裡多模態彈藥比較足的一個,但只跑自家模型、生態也有些封閉。百度搭子入局較晚但動作密集、持續升級,7月剛甩出個人版升級、企業版和“搭子聯盟”三個更新。QoderWork是阿里把Agent能力從代碼搬到辦公的產物,招牌是帶下載量排行的技能市場和15套專家套件,即將要升格為“千問辦公”的底座。一線城市機場和地鐵的廣告位上,大家都說自己是六邊形戰士。但用戶更多隻關心一件事:今天要選一款Agent,到底誰能真正幹活?這次,我們挑兩個高頻

在下一個模型發佈之前
在下一個模型發佈之前山上2026.07.22 11:34 · 來自北京全文3156字00:00 / 08:27脆弱的模型時代。文 | 山上,作者 I 薛星星,編輯 I 蔣澆像所有 AI 行業人士一樣,月之暗面創始人楊植麟喜歡用“AI 一天,人間一年”的說法形容 AI 的迅速迭代。對於剛剛發佈的 Kimi K3 而言,似乎沒有什麼形容比這句話更為貼切。月之暗面成立至今已有三年,但過去三年的所有積累可能都抵不上這三天的轟動。

二級市場投資人WAIC上談AI下一輪機會:國產算力鏈、模型公司商業化和估值空間
這篇消息聚焦「二級市場投資人WAIC上談AI下一輪機會:國產算力鏈、模型公司商業化和估值空間」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.
