IT之家生成式AI

小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅

2026年7月22日 08:44
小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅

重點摘要

首頁 > 智能時代>人工智能 小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅 量子位 2026/7/22 8:44:19 責編:故淵 評論: 感謝IT之家網友 ZERO_A_ONE 的線索投遞! 剛剛,IMO 2026 成績新鮮出爐,大模型交卷今年捲到了新高度。經 IMO 官方評定,小紅書大模型 dots-note-3.0,六道題全部答對,以滿分成績斬獲金牌。含金量有多高呢?

站內 AI 整理稿

# 小紅書大模型 IMO 2026 滿分奪金,自然語言端到端證明技驚四座

日前,國際數學奧林匹克競賽(IMO)2026 年成績正式揭曉,小紅書旗下大模型 dots-note-3.0 以六題全對、滿分 42 分的成績斬獲金牌,成為首個獲得 IMO 官方金牌水平認證的中國大模型,也是繼去年谷歌 Gemini 之後全球第二個達成此項成就的模型。更令人矚目的是,小紅書模型不僅全部答對,還是在滿分標準下完成——谷歌去年僅答對五題,拿下銀牌,直到今年才以五題半的金牌成績追平,而小紅書首次登上這項頂尖競賽便直接攻下滿分,業界震驚。 ## 金牌線驟降難度反升,滿分成績含金量十足

本屆 IMO 金牌線為 29 分,較去年的 35 分大幅下滑 6 分,幾乎等於一整道大題的分數,反映出試題整體難度顯著提升。在這種情況下,小紅書大模型 dots-note-3.0 能拿下 42 分滿分,意味著它不僅越過了金牌門檻,更抵達了這份試卷所能衡量的最高點。正如業內人士所言,金牌代表頂尖,滿分則是在頂尖之中再完成一次極小概率的篩選。從評審標準來看,選手不僅要給出正確答案,還必須提交邏輯完整、可逐段審查的證明過程,這對大模型的推理連貫性與嚴謹性提出了極高要求。 ## IMO:大模型推理能力的終極試金石

IMO 之所以被全球 AI 實驗室視為必爭之地,在於其無可替代的測評價值。每年試題由專家命制,賽前嚴格保密,模型無法靠「背題」得分;考試要求選手在 4.5 小時內完成三道題,全程以自然語言撰寫證明,不能僅靠計算得出答案。這直接考核模型在面對全新問題時的理解、探索、組織與驗證能力,與常規 Benchmark 有著本質區別。去年谷歌 Gemini 首次參賽耗時數天且需將題目翻譯成形式化語言,今年才實現自然語言端到端證明,而小紅書大模型 dots-note-3.0 一步到位,直接以英文題目輸入、自然語言證明輸出,完整閉環展現出可遷移的通用推理能力。 ## 智能體架構疊加遞歸自我批判

據了解,dots-note-3.0 採用智能體方式解題:模型先用自然語言理解題意,再結合 Python 代碼執行來輔助推理與驗算,同時在過程中引入遞歸自我批判機制,即讓模型不斷回頭審視自己的論證是否嚴密、是否有遺漏步驟。這種「邊想邊驗」的架構大幅降低了邏輯跳步的風險,讓模型能夠像人類選手一樣反覆推敲,直至產出完整證明。正是有了這套穩定且可擴展的推理系統,dots-note-3.0 才能在六道涵蓋代數、組合、幾何、數論的題目中連續拿滿,不靠偶然靈感,而是系統性的能力輸出。 ## 第三題解法驚艷冠軍選手:結構緊湊、直擊本質

如果說滿分已足夠震撼,那麼 dots-note-3.0 在第三題——一道組合博弈問題——上展現的創新思維,則讓數學界為之驚嘆。常見解法是將原問題轉化為圖論連通性問題再構造證明,已經相當巧妙;但 dots-note-3.0 完全跳脫這一路徑,轉而採用歸納法,設計出恰到好處的歸納對象與歸納命題。雙 CMO 金牌得主劉涵祚評價:「模型最終給出了一條正確且漂亮的證明思路,結構緊湊、邏輯自然,即使放在 IMO 解答中也屬於簡潔優雅的一類。」另一位 CMO 金牌得主汪千桐則指出:「常規解法已經很巧妙,但 dots 直接攻克了題目最難、最本質的部分。看完後會覺得每一步都順理成章,但人類選手很難想到能從這個角度切入。」這種直擊本質的歸納路徑,讓模型不只會算,更會「想」。 ## 小紅書技術實力首次全面亮相

過去外界對小紅書的技術認知多停留在內容社區與推薦算法,在基礎大模型領域並無太多公開聲音。此次以 IMO 滿分金牌一鳴驚人,小紅書用一份不需複雜解釋的成績單,向行業展示了其模型團隊在深度推理方面的紮實功底。從參數規模到 Benchmark 百分點,行業往往需要多重指標來評估模型;而 IMO 滿分傳遞的信號極其清晰——小紅書已經具備值得業界認真審視的基礎模型能力,成為基礎模型賽道上不可忽視的新玩家。 ## 即將開源,推動數學推理能力共享

小紅書方面透露,dots-note-3.0 將於近期開源,屆時學術界與開發者均可檢驗其推理過程與架構設計。這一步不僅有助於加速數學推理領域的研究,也讓更多團隊能夠藉助該模型的思路應對複雜任務。數學向來被視為 AI 智力與推理能力的試金石,能在 IMO 奪金意味著模型已站上解決高難度未知問題的台階,而開源則將這份能力從封閉賽場推向開放生態。 ## 從競賽到科研,大模型數學能力持續突破

值得一提的是,就在本屆 IMO 成績出爐前後,其他大模型也在數學前沿取得進展:Fable 5 參與構造了雅可比猜想長達 87 年的反例,雖尚未正式同行評審,卻標誌著大模型已開始涉足真正的數學發現。IMO 金牌正是通往科研深水區前最硬核的能力門檻。從谷歌到小紅書,從銀牌到滿分,大模型在數學競賽中的躍遷速度遠超預期,而 dots-note-3.0 的滿分表現,無疑將這條躍遷曲線推向了新的高點。

Related

相關文章

鈦媒體生成式AI

Kimi K3其實“賤賣”了

Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

剛剛
IT之家生成式AI

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App

Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。

剛剛

大模型正在“變小”?

# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。

剛剛

七月起,大模型進入「無限戰爭」

# 七月起,大模型进入“无限战争” 2026年7月,全球大模型产业迎来一道分水岭。市场猛然意识到,在这个行业里,没有任何一个模型性能的领先地位是安全的——胜利的保质期正以月甚至周为单位缩短。 短短几周内,中国五家头部独立大模型公司各自展开了截然不同却同样急迫的行动。智谱以4.2%的新增股份换取314亿港元融资,并宣布两年内不追求短期变现;MiniMax在同一周推出160亿港元的配股加可转债组合,创始人宣布零薪酬直至实现AGI;月之暗面发布了参数规模达2.

剛剛