小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅

重點摘要
小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅 中國大模型首次獲得IMO官方金牌水平認證,而且一出手就是滿分。2026年國際數學奧林匹克競賽(IMO)成績正式公布,小紅書自研的大模型dots-note-3.0以六題全對的成績拿下42分滿分,順利奪金。這不僅是中國大模型在IMO官方評測中取得的最高成就,也是全球範圍內繼Google Gemini模型之後,第二個達到此水準的大模型。值得注意的是,Google當年僅答對五題,小紅書則是一分未失,成績更為亮眼。 小紅書大模型dots-note-3.
小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅
中國大模型首次獲得IMO官方金牌水平認證,而且一出手就是滿分。2026年國際數學奧林匹克競賽(IMO)成績正式公布,小紅書自研的大模型dots-note-3.0以六題全對的成績拿下42分滿分,順利奪金。這不僅是中國大模型在IMO官方評測中取得的最高成就,也是全球範圍內繼Google Gemini模型之後,第二個達到此水準的大模型。值得注意的是,Google當年僅答對五題,小紅書則是一分未失,成績更為亮眼。小紅書大模型dots-note-3.0首次登上世界級數學競賽舞台便迎來開門紅,其解題方式也讓外界大開眼界。
模型全程僅使用自然語言完成從讀題、解析到撰寫證明的所有步驟,最終答案不僅全部正確,還在部分題目上提出了非常規的創新解法。尤其是第三題的解答,讓多位頂尖數學競賽選手讚不絕口。雙CMO金牌得主劉涵祚在觀摩完整解答後表示,模型給出的證明思路不僅正確,而且非常漂亮。他認為這種解法結構緊湊、邏輯自然,即使放在人類選手的IMO解答中,也屬於簡潔優雅的一類。另一位CMO金牌得主汪千桐也給出相似評價,他從數學審美的角度指出,小紅書大模型的解答漂亮且優雅,常規解法已經很巧妙,但dots-note-3.0直接攻克了題目最難、也最本質的部分。
看完之後會覺得每一步都順理成章,但真正拿到題目時,人類選手很難想到能從這個角度切入。換句話說,IMO滿分金牌或許還遠不是dots-note-3.0能力的上限。要理解這個成績的含金量,得先了解IMO是什麼。IMO全稱國際數學奧林匹克競賽,每年匯集全球頂尖中學生同場競技。陶哲軒等近半數菲爾茲獎得主都曾參加IMO,Google聯合創始人Sergey Brin也拿過金牌。比賽分兩天進行,每天4.5小時完成三道題,總共六道題,涵蓋代數、組合、幾何、數論四個方向,每題7分,滿分42分。參賽者不僅要給出答案,還必須寫出邏輯完整、可逐步審查的證明過程,這對大模型來說是極高難度的挑戰。
大模型爭相參加IMO,背後的原因在於數學是檢驗模型智力與推理能力的試金石。模型在數學競賽中表現越好,越能證明其底層推理能力的優勢。以Google Gemini為例,2024年首次挑戰IMO時僅獲28分銀牌,且系統需先將自然語言題目翻譯成Lean等形式化語言,部分題目耗時數天。2025年Gemini Deep Think直接以自然語言端到端完成證明,用4.5小時解決五道題,終於拿到金牌。這背後是一次跨代的能力躍遷。更近的例子是,本週Fable 5參與構造了一個雅可比猜想反例。該猜想自1939年提出以來懸而未決長達87年,連張益唐等頂尖數學家都曾在此折戟。
雖然該反例尚未經過正式同行評審,但已標誌著大模型現階段的能力足以參與真正的數學發現。而數學競賽正是模型進入科研深水區之前,那道最硬核的能力門檻。IMO還有一個相比傳統Benchmark得天獨厚的優勢——未知。每屆賽題由專家命制,在正式比賽前嚴格保密,模型無法提前拿到原題,也無法進行針對性訓練。一位頭部模型研究員指出,在今天的模型訓練中,互聯網上一旦出現某些數據,很快就會被模型拿去訓練,模型也就知道了。所以如果要測試模型到底聰不聰明,只能測一些沒有公開過的東西。
這正是同步參與官方IMO測評最難複製的價值,考驗的不是模型記住了多少題目和數學知識,而是在一個真正未知的問題第一次出現時,模型能否獨立理解、探索並完成嚴密推理。而且僅有新題還不夠,官方評測採用嚴格的當屆賽事流程。每個比賽日的學生考試結束後,模型團隊才會收到當天題目,並須在規定期限內提交PDF答卷。模型直接閱讀英文題目並生成證明,工作人員只負責保障系統運行。最終答卷由來自不同國家的IMO評審員按照正式標準審閱。本屆新題、規定時間、完整證明、第三方專業評審,這些條件同時成立,才讓IMO成為現今很難靠背題和包裝繞過去的能力大考。正因如此,小紅書大模型dots-note-3.
0能拿到金牌,而且是滿分,才顯得格外醒目。六道題全部做對,首先證明的是Agentic推理系統的穩定性。模型需要讀懂自然語言條件,判斷哪些信息真正關鍵,提出可能成立的中間結論,再將它們組織成一套完整證明。過程中任何一個條件被誤讀、任何一次推導跳步,都會留下可以被評審直接指出的漏洞。dots-note-3.0能在六類不同問題中連續拿滿,意味著它的表現並非依賴某一道題上的偶然靈感迸發。其次,小紅書大模型直接一步到位使用自然語言端到端處理,也意味著模型能夠像人類選手一樣直接讀懂題目、自主尋找路徑,具備從問題理解到答案表達的完整閉環。這代表模型擁有可遷移的通用推理能力。
具體來說,在答題過程中,dots-note-3.0採用智能體方式,讓模型使用自然語言結合Python程式碼執行來推理解題,同時藉助遞歸自我批判能力審視自己的論證,從而解決更多現實中的複雜任務。不過,真正讓人感到驚喜的還是第三題傳遞出的模型創新思維。這是一道組合博弈問題,網上常見的解法是先將原問題轉化成圖論中的連通性問題,再借助圖論語言建立證明。這條路線本身已經非常巧妙,但dots-note-3.0沒有沿用它,而是轉用歸納法。模型抓住了問題最本質的結構,設計出恰到好處的歸納對象與歸納命題。這也解釋了為什麼CMO得主汪千桐會用漂亮和優雅來形容這套答案。
模型對問題結構的剖析之深,會讓人自然而然產生一種恍然大悟的感覺。回到結果本身,模型能夠在本屆拿下滿分,其實相當不易。從幾個層面來看,本屆整套賽題的得分難度明顯高於去年。2026年IMO金牌線為29分,去年則高達35分,短短一年金牌線下降了6分,幾乎是一整道題的分數。所以這一屆的金牌,較之去年的Gemini,分量更重。滿分與金牌之間亦有差距,今年整整相差13分。29分意味著選手完整解決四道題,再從剩餘兩道題中拿到1分,就能進入金牌區間。而dots-note-3.0全部all in,直接抵達了這套試卷能夠衡量的最高點。滿分只是卷面的上限,不是它的上限。
金牌代表進入全球最頂尖的一批,滿分則代表在這批頂尖選手中再完成一次極小概率篩選。選擇IMO作為起始站,也是小紅書非常聰明的一步。如今行業內要將大模型底層技術能力推廣出去,通常有兩個方向,一個是程式碼,另一個就是數學。原因很簡單,這兩種任務的結果都很難靠語言包裝矇混過關,相比知識問答和主觀評測,它們更直接地考查模型能否真正理解複雜問題、拆解任務並持續推進。IMO更是其中的佼佼者,知名度高、業內認可度也夠,直接給出的是模型面對高難度未知問題時所展現的深度推理能力。對小紅書而言,這是一次重要的技術亮相。過去外界對小紅書的技術認知,更多集中在內容社區、推薦演算法和內容理解上。
在基礎模型領域,小紅書究竟處於什麼位置,一直缺少一份足夠公開權威且不需要複雜解釋的成績單。參數規模很難直接等同於能力,常規Benchmark上的幾個百分點也難讓行業形成鮮明認知。IMO滿分不一樣,42分就擺在那裡,足以證明小紅書已經具備值得行業認真審視的基礎模型能力。它用一枚IMO滿分金牌,讓行業第一次看清了自己的技術成色——基礎模型領域,出現了一個值得關注的新玩家。據悉,dots-note-3.0對應模型即將開源,敬請期待。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。