何夕2077模型更新

小紅書模型奪IMO滿分金牌

2026年8月4日 00:00

重點摘要

小紅書模型奪IMO滿分金牌。 dots-note-3.0在機器之心原文獲官方滿分。六題全拿7分,評閱���確認。自我糾錯串起證明檢查。團隊再推VibeAgentBench測長任務。

站內 AI 整理稿

小紅書旗下模型 dots-note-3.0 在國際數學奧林匹克(IMO)級別測試中創下佳績,以滿分六題、每題 7 分的表現通過機器之心官方評閱確認,奪下全數滿分金牌。這項成績顯示模型在數學推理與證明能力上已突破過往瓶頸,並非僅靠答案猜測,而是能產出完整且可驗證的解題流程。據了解,dots-note-3.0 在解題過程中採用「自我糾錯」機制,能反覆檢查證明步驟並修正邏輯漏洞,最終串起嚴謹的證明鏈路,確保每個環節都站得住腳。這也讓它在面對高難度競賽題時,能穩定輸出正確答案,獲得評閱方一致肯定。這項突破的意義,並不只停留在競賽成績的表面。

數學競賽題目往往涉及多步驟的抽象推理,以及對邏輯一致性的極高要求,過去一直是大型語言模型的痛點。dots-note-3.0 這次以滿分通過評閱,等於是向外界展示了模型在高度結構化的推理任務上,已經具備了相當可靠的水準。除了競賽成績,團隊同步推出 VibeAgentBench 評測基準,聚焦長程任務執行能力。此舉被視為從「解題能力」延伸到「真實場景任務」的布局,後續模型在規劃、工具使用與多步驟執行上的表現,將成為新一輪觀察重點。所謂的長程任務,指的是那些無法靠單一指令或單一步驟就完成,而是需要模型在過程中進行整體規劃、適時運用外部工具,並在多個步驟之間保持連貫性的複雜任務。

這類任務的難度,往往比單純回答一道數學題來得更高,也更加貼近真實世界的應用場景。從 dots-note-3.0 的數學滿分,到 VibeAgentBench 的推出,外界普遍解讀這是小紅書團隊從「解題能力」向「真實場景任務」延伸的明確布局。數學競賽驗證的是模型在封閉、嚴謹的邏輯體系中的推理極限;而長程任務執行的測驗,則是在模擬模型進入開放、動態的真實環境後,能否把這套推理能力實際應用在解決繁雜問題上。兩者之間的銜接,恰好構成了 AI 能力從理論走向實務的關鍵路徑。

後續模型的表現會是如何,特別是在規劃能力、工具使用以及多步驟執行這幾個面向上,能否交出與數學證明同樣漂亮的成績單,已經成為這一輪 AI 競賽中新的觀察重點。對於整個業界來說,dots-note-3.0 這次的表現,無疑提供了一個值得深入研究的案例,也為下一代模型在推理與執行能力的整合上,立下了一個更具體的標竿。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前