IT之家生成式AI

超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能體知識工作跑分僅次於 Claude Fable 5

2026年7月24日 14:33
超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能體知識工作跑分僅次於 Claude Fable 5

重點摘要

Artificial Analysis 於 7 月 22 日更新 AI 智能體知識工作基準 AA-Briefcase,顯示 Kimi K3 模型斬獲 1543 分,超過 GPT-5.6 Sol(1501 分),僅次於 Claude Fable 5 模型(1574 分)。

站內 AI 整理稿

人工智慧基準測試機構 Artificial Analysis 於 7 月 22 日更新了一項專為 AI 智能體設計的知識工作評測項目「AA-Briefcase」,最新跑分結果顯示,月之暗面(Moonshot AI)推出的 Kimi K3 模型以 1543 分位居第二,不僅超越 OpenAI 的 GPT-5.6 Sol 模型(1501 分),更僅次於 Anthropic 的 Claude Fable 5 模型(1574 分)。這項成績讓 Kimi K3 成為目前全球 AI 智能體知識工作能力排名中,唯一能與頂尖模型正面抗衡的中國團隊產品。

AA-Briefcase 是 Artificial Analysis 專門為衡量 AI 模型在智能體情境下的知識工作表現所設計的評測基準。有別於傳統的問答或語言理解測試,這項基準更側重於模擬真實工作場景中,模型需要進行的多步驟推理、資訊整合、文件分析與決策支援等複雜任務。Kimi K3 在這次測試中拿下 1543 分,代表它在處理這類高階知識工作時,已達到業界頂尖水準,並且在細項表現上與榜首的 Claude Fable 5 僅有約 2% 的差距。值得注意的是,OpenAI 的旗艦模型 GPT-5.

6 Sol 此次被 Kimi K3 壓制,以 1501 分落居第三,凸顯出中國 AI 團隊在模型能力上的快速追趕。過去一年多來,月之暗面持續投入大型語言模型的研發,Kimi K3 被視為其最新一代的技術成果,不僅在長文本理解與對話能力上有所突破,更在智能體應用場景中展現出優異的適應性。這項成績也讓外界對中國 AI 產業的競爭力產生新的評估。目前整體排名榜首仍由 Anthropic 的 Claude Fable 5 保持,該模型以 1574 分穩坐第一,展現出極高的知識工作處理能力。Claude 系列向來以安全性和可控性著稱,Fable 5 作為最新版本,進一步強化了多步驟推理與工具使用能力。

然而,Kimi K3 與之僅有 31 分的差距,約當 2% 的勝率差異,這意味著在實際應用中,兩者可能在許多任務上表現相當接近,後續的競爭態勢極具看點。從更宏觀的角度來看,AA-Briefcase 這項評測的出現,反映了 AI 業界對模型能力評估的標準正在轉變。過去大家關注的是模型的語言流暢度或知識問答準確率,但隨著 AI 智能體逐漸被導入企業流程、研究分析與自動化決策,如何衡量模型在真實工作環境中的實用性,成為更重要的課題。Artificial Analysis 選擇在 7 月 22 日更新這項基準,也顯示出業界對智能體知識工作能力的重視程度正在快速提升。

對於月之暗面而言,Kimi K3 的出色表現不僅是技術上的肯定,也為該公司在國際市場的競爭力加分。月之暗面成立於 2023 年,總部位於北京,專注於通用人工智慧與大型語言模型的研發,其 Kimi 系列產品以長文本處理能力聞名。此次在 AA-Briefcase 中擊敗 GPT-5.6 Sol,無疑讓更多人關注到這家中國 AI 新創的技術實力。Anthropic 方面,Claude Fable 5 雖然仍保持領先,但面對來自中國團隊的強力挑戰,勢必會加速其模型迭代的腳步。OpenAI 則面臨旗艦產品被超越的壓力,未來 GPT 系列是否能推出更強版本來重新奪回智能體領域的優勢,將是業界關注的焦點。

整體來看,這份最新跑分結果不僅是單一模型的排名變動,更暗示了 AI 競賽的格局正在發生變化。過去主要由美國企業主導的頂尖模型榜單,如今出現了中國團隊的身影,且差距極小。隨著更多 AI 智能體應用場景落地,知識工作能力將成為評判模型價值的核心指標之一,而 Kimi K3 與 Claude Fable 5 之間的拉鋸戰,也將為未來數月的 AI 發展史寫下關鍵篇章。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

13 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

14 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

18 分鐘前