IT之家生成式AI

AI 大模型周榜:國產 Kimi K3 首次殺入綜合榜 Top 10,登頂前端開發榜

2026年7月20日 18:38
AI 大模型周榜:國產 Kimi K3 首次殺入綜合榜 Top 10,登頂前端開發榜

重點摘要

首頁 > 智能時代>人工智能 AI 大模型周榜:國產 Kimi K3 首次殺入綜合榜 Top 10,登頂前端開發榜 2026/7/20 18:38:43 來源:IT之家 作者:小泵 責編:小泵 評論: IT之家 7 月 20 日消息,Arena(arena.ai)平臺發佈了 2026-29 期大模型排行榜,統計週期為 2026 年 7 月 13 日 ~2026 年 7 月 19 日。

站內 AI 整理稿

AI 大模型權威評測平台 Arena(arena.ai)於 7 月 20 日發布 2026 年第 29 期大模型排行榜,統計區間為 7 月 13 日至 7 月 19 日。本期榜單迎來大批新模型集中入榜,其中最受矚目的莫過於國產模型 kimi-k3 的突出表現:它不僅首次殺入綜合能力 Top 10,更直接登頂前端開發榜榜首,在特定細分領域實現了對多數海外頭部模型的反超。整體來看,多家國產模型在多個榜單的前列站穩腳跟,大陸 AI 陣營的梯隊完整度進一步提升。在綜合榜方面,頭部位置主要由 Claude、Meta、Google、OpenAI 等廠商的新模型主導。

第一名依然由 Anthropic 的 claude-fable-5 佔據,ELO 分數為 1507 分。Anthropic 旗下多款思考版本模型集中入駐前五名,彼此之間分差全部在 15 分以內,在誤差範圍內屬於並列第一梯隊。本週最大亮點是國產模型 kimi-k3 憑藉 1486 分 ELO 排名第九,首次躋身綜合榜前十,與第八名的 gemini-3-pro、第十名的 gpt-5.6-sol-xhigh 分數完全一致,處於第一梯隊邊緣位置。其他國產模型在綜合榜中上游表現穩定:阿里 qwen3.7-max-preview 排名第十八,ELO 1475 分;智譜 glm-5.

1 排名第二十七,ELO 1471 分;智譜 glm-5.2 (max) 排名第三十,ELO 1468 分。在代碼榜方面,榜首位置發生變動。claude-opus-4-7-thinking 從第二名升至第一名,ELO 分數 1553 分,將此前排名第一的 claude-fable-5 擠到第二名,後者分數降至 1551 分,兩者僅有 2 分差距,屬於並列第一梯隊。Anthropic 的多款思考模型幾乎包攬前七名,整體統治力依然強勁。國產模型 kimi-k3 首次進入代碼榜前十,排名第十,ELO 1529 分,與第九名僅差 1 分,表現相當接近第一梯隊。

其他國產模型在代碼榜覆蓋多段位梯隊:阿里 qwen3.7-max-preview 排名第十二,ELO 1527 分;智譜 glm-5.1 排名第十七,ELO 1521 分;小米 mimo-v2.5-pro 排名第二十四,ELO 1518 分;月之暗面 kimi-k2.6 排名第二十六,ELO 1515 分;百度 ernie-5.1 排名第二十七,ELO 1514 分。前端開發榜呈現出前所未有的格局。國產模型 kimi-k3 直接以 1679 分的高 ELO 穩居第一名,大幅領先第二名 claude-fable-5 的 1631 分,分差達到 48 分,優勢極為明顯。

第四名同樣由國產模型 glm-5.2 (max) 拿下,ELO 1587 分,超過了多款 Claude、OpenAI 的旗艦模型。這意味著國產大模型在前端開發這一細分場景的能力已經走在全球最前列。其他國產模型在前端開發榜佔據頭部與中上游位置:字節跳動 seed-2.1-pro-preview 排名第十四,ELO 1534 分,首次入駐榜單前半區;智譜 glm-5.1 排名第十五,ELO 1526 分;阿里 qwen3.7-max-20260517 排名第十七,ELO 1516 分;月之暗面 kimi-k2.6 排名第十八,ELO 1515 分。智能體榜本週全部為全新入榜模型。

排名第一的是 Claude Fable 5 (High),淨提升度 13.94%,同時擁有 30.65% 的最高好評/差評比,工具幻覺率僅 1.33%。第二名 GPT 5.6 Sol (xHigh) 的可控性數值最高,達到 17.26%。頭部三款模型的淨提升度差距明顯大於各自的置信區間,屬於表現分層的清晰格局。國產模型 GLM 5.2 (Max) 殺入榜單前十,位列第九,淨提升度為 6.24%,其 Bash 恢復速度僅 4.45,遠好於頭部平均水平,命令出錯後能快速恢復,表現突出。其他國產模型在智能體榜覆蓋靠前和中間位置,工具相關能力表現亮眼:智譜 glm-5.1 排名第十六,淨提升度 1.

19%;阿里 qwen3.7 Plus 排名第十八,淨提升度 0.61%,工具幻覺率僅 0.19%;月之暗面 kimi-k2.7-code 排名第二十,淨提升度 0.76%;阿里 qwen3.7 Max 排名第二十一,淨提升度 0.81%;深度求索 deepseek-v4-pro 排名第二十二,淨提升度 1.11%。在 AI 生圖榜方面,本週整體格局穩定。OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 穩居第一,字節跳動 seedream-5.0-pro 作為最高排名的國產模型位列第十一,ELO 1231 分,緊隨多款海外頭部生圖模型之後。

而在 AI 視頻榜,Google gemini-omni-flash 位列榜首;字節跳動的 dreamina-seedance-2.0-720p 穩居第二名,ELO 分數 1482 分,表現遠超多數海外視頻生成模型;同時阿里 happyhorse-1.0 也拿下第四名,顯示國產力量在 AI 視頻生成第一梯隊已經佔據重要席位。本週 Arena 榜單的最大亮點在於國產模型的多點突破,尤其是 kimi-k3 首次衝進綜合榜前十,並且直接登頂前端開發榜,證明國產大模型不僅在通用能力上追平第一梯隊,在特定工程類任務場景已經形成領先優勢。

同時字節跳動、阿里、智譜等廠商的多款模型也在代碼、生圖、視頻、智能體等多個榜單的前半區站穩腳跟。隨著更多用戶評測數據進一步積累,部分新入榜模型的排名與分數還可能出現小幅變動,後續國產模型能否在更多細分榜單拿下榜首位置,值得持續關注。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

37 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前