小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅

重點摘要
小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅 中國大模型首次獲得IMO官方金牌水平認證,而且一出手就是滿分。2026年國際數學奧林匹克競賽(IMO)成績正式公布,小紅書自研的大模型dots-note-3.0以六題全對的成績拿下42分滿分,順利奪金。這不僅是中國大模型在IMO官方評測中取得的最高成就,也是全球範圍內繼Google Gemini模型之後,第二個達到此水準的大模型。值得注意的是,Google當年僅答對五題,小紅書則是一分未失,成績更為亮眼。 小紅書大模型dots-note-3.
小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅
中國大模型首次獲得IMO官方金牌水平認證,而且一出手就是滿分。2026年國際數學奧林匹克競賽(IMO)成績正式公布,小紅書自研的大模型dots-note-3.0以六題全對的成績拿下42分滿分,順利奪金。這不僅是中國大模型在IMO官方評測中取得的最高成就,也是全球範圍內繼Google Gemini模型之後,第二個達到此水準的大模型。值得注意的是,Google當年僅答對五題,小紅書則是一分未失,成績更為亮眼。 小紅書大模型dots-note-3.0首次登上世界級數學競賽舞台便迎來開門紅,其解題方式也讓外界大開眼界。模型全程僅使用自然語言完成從讀題、解析到撰寫證明的所有步驟,最終答案不僅全部正確,還在部分題目上提出了非常規的創新解法。尤其是第三題的解答,讓多位頂尖數學競賽選手讚不絕口。 雙CMO金牌得主劉涵祚在觀摩完整解答後表示,模型給出的證明思路不僅正確,而且非常漂亮。他認為這種解法結構緊湊、邏輯自然,即使放在人類選手的IMO解答中,也屬於簡潔優雅的一類。另一位CMO金牌得主汪千桐也給出相似評價,他從數學審美的角度指出,小紅書大模型的解答漂亮且優雅,常規解法已經很巧妙,但dots-note-3.0直接攻克了題目最難、也最本質的部分。看完之後會覺得每一步都順理成章,但真正拿到題目時,人類選手很難想到能從這個角度切入。換句話說,IMO滿分金牌或許還遠不是dots-note-3.0能力的上限。 要理解這個成績的含金量,得先了解IMO是什麼。IMO全稱國際數學奧林匹克競賽,每年匯集全球頂尖中學生同場競技。陶哲軒等近半數菲爾茲獎得主都曾參加IMO,Google聯合創始人Sergey Brin也拿過金牌。比賽分兩天進行,每天4.5小時完成三道題,總共六道題,涵蓋代數、組合、幾何、數論四個方向,每題7分,滿分42分。參賽者不僅要給出答案,還必須寫出邏輯完整、可逐步審查的證明過程,這對大模型來說是極高難度的挑戰。 大模型爭相參加IMO,背後的原因在於數學是檢驗模型智力與推理能力的試金石。模型在數學競賽中表現越好,越能證明其底層推理能力的優勢。以Google Gemini為例,2024年首次挑戰IMO時僅獲28分銀牌,且系統需先將自然語言題目翻譯成Lean等形式化語言,部分題目耗時數天。2025年Gemini Deep Think直接以自然語言端到端完成證明,用4.5小時解決五道題,終於拿到金牌。這背後是一次跨代的能力躍遷。 更近的例子是,本週Fable 5參與構造了一個雅可比猜想反例。該猜想自1939年提出以來懸而未決長達87年,連張益唐等頂尖數學家都曾在此折戟。雖然該反例尚未經過正式同行評審,但已標誌著大模型現階段的能力足以參與真正的數學發現。而數學競賽正是模型進入科研深水區之前,那道最硬核的能力門檻。 IMO還有一個相比傳統Benchmark得天獨厚的優勢——未知。每屆賽題由專家命制,在正式比賽前嚴格保密,模型無法提前拿到原題,也無法進行針對性訓練。一位頭部模型研究員指出,在今天的模型訓練中,互聯網上一旦出現某些數據,很快就會被模型拿去訓練,模型也就知道了。所以如果要測試模型到底聰不聰明,只能測一些沒有公開過的東西。這正是同步參與官方IMO測評最難複製的價值,考驗的不是模型記住了多少題目和數學知識,而是在一個真正未知的問題第一次出現時,模型能否獨立理解、探索並完成嚴密推理。 而且僅有新題還不夠,官方評測採用嚴格的當屆賽事流程。每個比賽日的學生考試結束後,模型團隊才會收到當天題目,並須在規定期限內提交PDF答卷。模型直接閱讀英文題目並生成證明,工作人員只負責保障系統運行。最終答卷由來自不同國家的IMO評審員按照正式標準審閱。本屆新題、規定時間、完整證明、第三方專業評審,這些條件同時成立,才讓IMO成為現今很難靠背題和包裝繞過去的能力大考。 正因如此,小紅書大模型dots-note-3.0能拿到金牌,而且是滿分,才顯得格外醒目。六道題全部做對,首先證明的是Agentic推理系統的穩定性。模型需要讀懂自然語言條件,判斷哪些信息真正關鍵,提出可能成立的中間結論,再將它們組織成一套完整證明。過程中任何一個條件被誤讀、任何一次推導跳步,都會留下可以被評審直接指出的漏洞。dots-note-3.0能在六類不同問題中連續拿滿,意味著它的表現並非依賴某一道題上的偶然靈感迸發。 其次,小紅書大模型直接一步到位使用自然語言端到端處理,也意味著模型能夠像人類選手一樣直接讀懂題目、自主尋找路徑,具備從問題理解到答案表達的完整閉環。這代表模型擁有可遷移的通用推理能力。具體來說,在答題過程中,dots-note-3.0採用智能體方式,讓模型使用自然語言結合Python程式碼執行來推理解題,同時藉助遞歸自我批判能力審視自己的論證,從而解決更多現實中的複雜任務。 不過,真正讓人感到驚喜的還是第三題傳遞出的模型創新思維。這是一道組合博弈問題,網上常見的解法是先將原問題轉化成圖論中的連通性問題,再借助圖論語言建立證明。這條路線本身已經非常巧妙,但dots-note-3.0沒有沿用它,而是轉用歸納法。模型抓住了問題最本質的結構,設計出恰到好處的歸納對象與歸納命題。這也解釋了為什麼CMO得主汪千桐會用漂亮和優雅來形容這套答案。模型對問題結構的剖析之深,會讓人自然而然產生一種恍然大悟的感覺。 回到結果本身,模型能夠在本屆拿下滿分,其實相當不易。從幾個層面來看,本屆整套賽題的得分難度明顯高於去年。2026年IMO金牌線為29分,去年則高達35分,短短一年金牌線下降了6分,幾乎是一整道題的分數。所以這一屆的金牌,較之去年的Gemini,分量更重。滿分與金牌之間亦有差距,今年整整相差13分。29分意味著選手完整解決四道題,再從剩餘兩道題中拿到1分,就能進入金牌區間。而dots-note-3.0全部all in,直接抵達了這套試卷能夠衡量的最高點。滿分只是卷面的上限,不是它的上限。金牌代表進入全球最頂尖的一批,滿分則代表在這批頂尖選手中再完成一次極小概率篩選。 選擇IMO作為起始站,也是小紅書非常聰明的一步。如今行業內要將大模型底層技術能力推廣出去,通常有兩個方向,一個是程式碼,另一個就是數學。原因很簡單,這兩種任務的結果都很難靠語言包裝矇混過關,相比知識問答和主觀評測,它們更直接地考查模型能否真正理解複雜問題、拆解任務並持續推進。IMO更是其中的佼佼者,知名度高、業內認可度也夠,直接給出的是模型面對高難度未知問題時所展現的深度推理能力。 對小紅書而言,這是一次重要的技術亮相。過去外界對小紅書的技術認知,更多集中在內容社區、推薦演算法和內容理解上。在基礎模型領域,小紅書究竟處於什麼位置,一直缺少一份足夠公開權威且不需要複雜解釋的成績單。參數規模很難直接等同於能力,常規Benchmark上的幾個百分點也難讓行業形成鮮明認知。IMO滿分不一樣,42分就擺在那裡,足以證明小紅書已經具備值得行業認真審視的基礎模型能力。它用一枚IMO滿分金牌,讓行業第一次看清了自己的技術成色——基礎模型領域,出現了一個值得關注的新玩家。據悉,dots-note-3.0對應模型即將開源,敬請期待。
Related
相關文章

AI醫療捲了10年終於悟了:不用替代醫生,而是給醫院裝上超強buff
這篇消息聚焦「AI醫療捲了10年終於悟了:不用替代醫生,而是給醫院裝上超強buff」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

一次測試,逼 OpenAI 最高模型,黑進了全球最大 AI 開源平臺
這篇消息聚焦「一次測試,逼 OpenAI 最高模型,黑進了全球最大 AI 開源平臺」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App
Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。

大模型正在“變小”?
# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。

七月起,大模型進入「無限戰爭」
# 七月起,大模型进入“无限战争” 2026年7月,全球大模型产业迎来一道分水岭。市场猛然意识到,在这个行业里,没有任何一个模型性能的领先地位是安全的——胜利的保质期正以月甚至周为单位缩短。 短短几周内,中国五家头部独立大模型公司各自展开了截然不同却同样急迫的行动。智谱以4.2%的新增股份换取314亿港元融资,并宣布两年内不追求短期变现;MiniMax在同一周推出160亿港元的配股加可转债组合,创始人宣布零薪酬直至实现AGI;月之暗面发布了参数规模达2.