IT之家生成式AI

小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅

2026年7月22日 08:44
小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅

重點摘要

首頁 > 智能時代>人工智能 小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅 量子位 2026/7/22 8:44:19 責編:故淵 評論: 感謝IT之家網友 ZERO_A_ONE 的線索投遞! 剛剛,IMO 2026 成績新鮮出爐,大模型交卷今年捲到了新高度。經 IMO 官方評定,小紅書大模型 dots-note-3.0,六道題全部答對,以滿分成績斬獲金牌。含金量有多高呢?

站內 AI 整理稿

# 小紅書大模型 IMO 2026 滿分奪金,自然語言端到端證明技驚四座

日前,國際數學奧林匹克競賽(IMO)2026 年成績正式揭曉,小紅書旗下大模型 dots-note-3.0 以六題全對、滿分 42 分的成績斬獲金牌,成為首個獲得 IMO 官方金牌水平認證的中國大模型,也是繼去年谷歌 Gemini 之後全球第二個達成此項成就的模型。更令人矚目的是,小紅書模型不僅全部答對,還是在滿分標準下完成——谷歌去年僅答對五題,拿下銀牌,直到今年才以五題半的金牌成績追平,而小紅書首次登上這項頂尖競賽便直接攻下滿分,業界震驚。 ## 金牌線驟降難度反升,滿分成績含金量十足

本屆 IMO 金牌線為 29 分,較去年的 35 分大幅下滑 6 分,幾乎等於一整道大題的分數,反映出試題整體難度顯著提升。在這種情況下,小紅書大模型 dots-note-3.0 能拿下 42 分滿分,意味著它不僅越過了金牌門檻,更抵達了這份試卷所能衡量的最高點。正如業內人士所言,金牌代表頂尖,滿分則是在頂尖之中再完成一次極小概率的篩選。從評審標準來看,選手不僅要給出正確答案,還必須提交邏輯完整、可逐段審查的證明過程,這對大模型的推理連貫性與嚴謹性提出了極高要求。 ## IMO:大模型推理能力的終極試金石

IMO 之所以被全球 AI 實驗室視為必爭之地,在於其無可替代的測評價值。每年試題由專家命制,賽前嚴格保密,模型無法靠「背題」得分;考試要求選手在 4.5 小時內完成三道題,全程以自然語言撰寫證明,不能僅靠計算得出答案。這直接考核模型在面對全新問題時的理解、探索、組織與驗證能力,與常規 Benchmark 有著本質區別。去年谷歌 Gemini 首次參賽耗時數天且需將題目翻譯成形式化語言,今年才實現自然語言端到端證明,而小紅書大模型 dots-note-3.0 一步到位,直接以英文題目輸入、自然語言證明輸出,完整閉環展現出可遷移的通用推理能力。 ## 智能體架構疊加遞歸自我批判

據了解,dots-note-3.0 採用智能體方式解題:模型先用自然語言理解題意,再結合 Python 代碼執行來輔助推理與驗算,同時在過程中引入遞歸自我批判機制,即讓模型不斷回頭審視自己的論證是否嚴密、是否有遺漏步驟。這種「邊想邊驗」的架構大幅降低了邏輯跳步的風險,讓模型能夠像人類選手一樣反覆推敲,直至產出完整證明。正是有了這套穩定且可擴展的推理系統,dots-note-3.0 才能在六道涵蓋代數、組合、幾何、數論的題目中連續拿滿,不靠偶然靈感,而是系統性的能力輸出。 ## 第三題解法驚艷冠軍選手:結構緊湊、直擊本質

如果說滿分已足夠震撼,那麼 dots-note-3.0 在第三題——一道組合博弈問題——上展現的創新思維,則讓數學界為之驚嘆。常見解法是將原問題轉化為圖論連通性問題再構造證明,已經相當巧妙;但 dots-note-3.0 完全跳脫這一路徑,轉而採用歸納法,設計出恰到好處的歸納對象與歸納命題。雙 CMO 金牌得主劉涵祚評價:「模型最終給出了一條正確且漂亮的證明思路,結構緊湊、邏輯自然,即使放在 IMO 解答中也屬於簡潔優雅的一類。」另一位 CMO 金牌得主汪千桐則指出:「常規解法已經很巧妙,但 dots 直接攻克了題目最難、最本質的部分。看完後會覺得每一步都順理成章,但人類選手很難想到能從這個角度切入。」這種直擊本質的歸納路徑,讓模型不只會算,更會「想」。 ## 小紅書技術實力首次全面亮相

過去外界對小紅書的技術認知多停留在內容社區與推薦算法,在基礎大模型領域並無太多公開聲音。此次以 IMO 滿分金牌一鳴驚人,小紅書用一份不需複雜解釋的成績單,向行業展示了其模型團隊在深度推理方面的紮實功底。從參數規模到 Benchmark 百分點,行業往往需要多重指標來評估模型;而 IMO 滿分傳遞的信號極其清晰——小紅書已經具備值得業界認真審視的基礎模型能力,成為基礎模型賽道上不可忽視的新玩家。 ## 即將開源,推動數學推理能力共享

小紅書方面透露,dots-note-3.0 將於近期開源,屆時學術界與開發者均可檢驗其推理過程與架構設計。這一步不僅有助於加速數學推理領域的研究,也讓更多團隊能夠藉助該模型的思路應對複雜任務。數學向來被視為 AI 智力與推理能力的試金石,能在 IMO 奪金意味著模型已站上解決高難度未知問題的台階,而開源則將這份能力從封閉賽場推向開放生態。 ## 從競賽到科研,大模型數學能力持續突破

值得一提的是,就在本屆 IMO 成績出爐前後,其他大模型也在數學前沿取得進展:Fable 5 參與構造了雅可比猜想長達 87 年的反例,雖尚未正式同行評審,卻標誌著大模型已開始涉足真正的數學發現。IMO 金牌正是通往科研深水區前最硬核的能力門檻。從谷歌到小紅書,從銀牌到滿分,大模型在數學競賽中的躍遷速度遠超預期,而 dots-note-3.0 的滿分表現,無疑將這條躍遷曲線推向了新的高點。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前