小紅書模型奪IMO滿分金牌
重點摘要
小紅書模型奪IMO滿分金牌。 dots-note-3.0在機器之心原文獲官方滿分。六題全拿7分,評閱���確認。自我糾錯串起證明檢查。團隊再推VibeAgentBench測長任務。
小紅書旗下模型 dots-note-3.0 在國際數學奧林匹克(IMO)級別測試中創下佳績,以滿分六題、每題 7 分的表現通過機器之心官方評閱確認,奪下全數滿分金牌。這項成績顯示模型在數學推理與證明能力上已突破過往瓶頸,並非僅靠答案猜測,而是能產出完整且可驗證的解題流程。 據了解,dots-note-3.0 在解題過程中採用「自我糾錯」機制,能反覆檢查證明步驟並修正邏輯漏洞,最終串起嚴謹的證明鏈路,確保每個環節都站得住腳。這也讓它在面對高難度競賽題時,能穩定輸出正確答案,獲得評閱方一致肯定。 這項突破的意義,並不只停留在競賽成績的表面。數學競賽題目往往涉及多步驟的抽象推理,以及對邏輯一致性的極高要求,過去一直是大型語言模型的痛點。dots-note-3.0 這次以滿分通過評閱,等於是向外界展示了模型在高度結構化的推理任務上,已經具備了相當可靠的水準。 除了競賽成績,團隊同步推出 VibeAgentBench 評測基準,聚焦長程任務執行能力。此舉被視為從「解題能力」延伸到「真實場景任務」的布局,後續模型在規劃、工具使用與多步驟執行上的表現,將成為新一輪觀察重點。 所謂的長程任務,指的是那些無法靠單一指令或單一步驟就完成,而是需要模型在過程中進行整體規劃、適時運用外部工具,並在多個步驟之間保持連貫性的複雜任務。這類任務的難度,往往比單純回答一道數學題來得更高,也更加貼近真實世界的應用場景。 從 dots-note-3.0 的數學滿分,到 VibeAgentBench 的推出,外界普遍解讀這是小紅書團隊從「解題能力」向「真實場景任務」延伸的明確布局。數學競賽驗證的是模型在封閉、嚴謹的邏輯體系中的推理極限;而長程任務執行的測驗,則是在模擬模型進入開放、動態的真實環境後,能否把這套推理能力實際應用在解決繁雜問題上。 兩者之間的銜接,恰好構成了 AI 能力從理論走向實務的關鍵路徑。後續模型的表現會是如何,特別是在規劃能力、工具使用以及多步驟執行這幾個面向上,能否交出與數學證明同樣漂亮的成績單,已經成為這一輪 AI 競賽中新的觀察重點。 對於整個業界來說,dots-note-3.0 這次的表現,無疑提供了一個值得深入研究的案例,也為下一代模型在推理與執行能力的整合上,立下了一個更具體的標竿。
Related
相關文章

美國政府完成先進 AI 模型自願性評估框架制定,內容未公開
美國政府已按期完成針對先進 AI 模型評估的自願性框架制定,但白宮未對外公開具體內容、審閱機構及採用時程。該框架原應涵蓋保密、網路安全、風險管理與智慧財產權等要求,不過相關基準測試與適用門檻被列為機密。白宮計劃與業界召開會議審查該框架,並與更多合作夥伴討論後續步驟。
智譜AI新一代大模型GLM-5.3意外曝光
智譜AI尚未正式發佈的新一代旗艦模型GLM-5.3,因官網頁面、搜索引擎緩存及開源代碼庫等多渠道的“意外”洩露而提前曝光。GLM-5.3的意外曝光,使得三大頭部廠商的頂級模型在短期內集中亮相,市場爭奪戰一觸即發。截至發稿,智譜AI官方並未就GLM-5.3的洩露事件及具體發佈時間做出正式回應。業內普遍預期,鑑於模型已進入公開測試或展示階段,智譜AI或將在近期擇機正式對外公佈GLM-5.3的詳細技術參數與上線計劃。
DeepSeek-V4-Flash登頂全球調用量榜首,國產大模型包攬前五
7月31日最新發布的DeepSeek-V4-Flash正式版以2.33萬億Token的調用量強勢登上榜單第八。DeepSeek-V4-Flash 0423版和DeepSeek-V4-Flash 0731版合計調用量斷層領先。僅8月3日一天,DeepSeek-V4-Flash 0731版的調用量就達到1.02萬億Token,超過此前霸榜的DeepSeek-V4-Flash 0423版。價格方面,V4-Flash的競爭力幾乎無人能敵。海外開發者集體沸騰DeepSeek V4-Flash正式版上線後,海外開發者社區的反應堪稱熱烈。研究機構Artificial Analysis更直言,DeepSeek-V4-Flash已成為全球知名模型中運行成本最低的一款。從7月31日API公測到8月3日登頂全球調用量榜首,DeepSeek-V4-Flash僅用了不到一週時間。

飛書變革的伏筆,字節早就埋好了
字節跳動將飛書產品團隊與豆包團隊整合,並將飛書GTM團隊併入火山引擎,這是字節跳動為加速AI商業化而進行的最大規模To B業務重組。此舉旨在讓飛書成為AI原生應用的載體,並整合豆包與火山引擎的能力,以搶佔桌面AI辦公入口,並應對高昂的AI基礎設施投入與商業化壓力。

阿里字節騰訊,為AI辦公拼了
字節跳動、阿里巴巴與騰訊在短短兩週內接連對AI辦公領域進行重大整合,分別將飛書、千問辦公及WorkBuddy等產品與AI能力深度綁定,意在搶佔下一代辦公入口。三家巨頭皆認為,辦公場景已成為大模型token變現效率最高的領域,且Agent技術已跨越可用性門檻,因此同步加速內部整合,以統一產品入口覆蓋全流程工作流。

Edge AI Daily 早報(8月4日)
AI 巨頭近期動作頻頻,從雲端服務、品牌信任到供應鏈布局,各項動態都牽動著產業神經。亞馬遜 AWS 近期宣布與新創公司 Superblocks 簽署多年聯合行銷協議,將 AI 應用生成工具(即所謂的 Vibe Coding)整合進企業私有雲環境。這項合作旨在解決自然語言生成程式碼所衍生的影子 IT 問題——JetBrains 2026 年調查顯示,高達九成開發者定期使用 AI 工具,但 Georgia Tech 追蹤發現,AI 生成程式碼直接導致的 CVE 漏洞在三個月內從 6 個飆升至 35 個。