AI 大模型周榜:Anthropic 多款新模型密集入榜,國產 kimi-k3-max 穩定頭部

2026年8月17日 16:02
AI 大模型周榜:Anthropic 多款新模型密集入榜,國產 kimi-k3-max 穩定頭部
站內 AI 整理稿

作者:小泵 責編:小泵 評論: 8 月 17 日消息,Arena(arena.ai)平臺發佈 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲測排名,本期最大看點是 Anthropic 多款 claude-opus-4 系列新模型密集入榜並佔據綜合榜前五位,國產模型 kimi-k3-max 排名上升 2 位至綜合榜第 12 位,在前端開發榜也保持第 2 位,qwen3.8-max 首次躋身智能體榜 Top 10。國產模型整體仍處於中上游位置,在前端開發等細分領域已經形成對頭部海外模型的緊追態勢。注:本榜單基於 Arena(arena.

ai)平臺匿名盲測投票,通過 ELO(智能體榜為百分比信號)計算排名,反映用戶主觀偏好而非絕對能力測試;不同分榜相互獨立,不宜跨榜比較,分差在誤差範圍內均視為並列,新模型也需積累一定投票量後才會正式入榜。綜合榜本期綜合榜頭部幾乎被 Anthropic 新模型包攬,claude-fable-5 以 1506 分蟬聯榜首,新入榜的 claude-opus-4-6-high 以 1505 分緊隨其後位列第二,同樣新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分數差距均在 5 分以內,屬於誤差範圍內的並列。谷歌 gemini-3.

7-flash-high 作為新模型首次入榜即拿到第 9 名,表現亮眼。國產模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的國產模型。國產模型整體處於榜單中上游,具體排名如下:月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,較上週上升 2 位;阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,較上週下降 2 位;阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,較上週下降 3 位。

排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-fable-5Anthropic1506 ±521533$10 / $501M2新上榜claude-opus-4-6-highAnthropic1505 ±472516$5 / $251M3新上榜claude-opus-4-7-highAnthropic1502 ±460331$5 / $251M4-muse-spark-1.2 (xHigh)Meta1498 ±103280$1.25 / $4.

25N/A5-claude-opus-4-6Anthropic1497 ±376474$5 / $251M6↑ 1claude-opus-4-7Anthropic1494 ±461419$5 / $251M7↑ 1claude-opus-5-highAnthropic1493 ±520030$5 / $251M8↓ 2qwen3.8-maxAlibaba1491 ±87004$2 / $61M9新上榜gemini-3.7-flash-highGoogle1490 ±85744$0.75 / $3.571.

05M10↓ 1claude-opus-5-maxAnthropic1489 ±79679$5 / $251M— 以下為 Top 10 外的國產模型 —12↑ 2kimi-k3-maxMoonshot1489 ±611969N/AN/A26↓ 3qwen3.7-max-previewAlibaba1474 ±103717$1.48 / $4.

431M代碼榜代碼榜格局同樣由 Anthropic 新模型主導,claude-fable-5 以 1554 分守住榜首位置,新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分別以 1552 分、 1551 分佔據第二、第三名,分數差距極小,誤差範圍內視為並列。kimi-k3-max 穩定在第六名,ELO 分數上漲 2 分,依然是排名最高的國產代碼模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名,是本週漲幅最大的頭部模型。

國產模型在代碼榜佔據多箇中上游席位,具體排名如下:月之暗面 kimi-k3-max 排名最高,位列第 6 名,ELO 1544 分,排名不變;阿里 qwen3.8-max 位列第 13 名,ELO 1529 分,較上週下降 5 位;阿里 qwen3.7-max-preview 位列第 17 名,ELO 1525 分,排名不變;小米 mimo-v2.5-pro 位列第 25 名,ELO 1520 分,較上週上升 3 位。

排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-fable-5Anthropic1554 ±95817$10 / $501M2新上榜claude-opus-4-7-highAnthropic1552 ±617272$5 / $251M3新上榜claude-opus-4-6-highAnthropic1551 ±618894$5 / $251M4↑ 1claude-opus-4-7Anthropic1548 ±617423$5 / $251M5↓ 1claude-opus-4-6Anthropic1547 ±621341$5 / $251M6-kimi-k3-maxMoonshot1544 ±113176N/AN/A7新上榜claude-opus-4-8-highAnthropic1533 ±711417$5 / $251M8↑ 7muse-spark-1.

2 (xHigh)Meta1533 ±20947$1.25 / $4.25N/A9↑ 2claude-opus-5-highAnthropic1531 ±95433$5 / $251M10↓ 1muse-spark-1.1Meta1531 ±95002$1.25 / $4.25N/A— 以下為 Top 10 外的國產模型 —13↓ 5qwen3.8-maxAlibaba1529 ±132146$2 / $61M17-qwen3.7-max-previewAlibaba1525 ±181120$1.48 / $4.431M25↑ 3mimo-v2.

5-proXiaomi1520 ±713986$0.44 / $0.871.05M前端開發榜前端開發榜頭部格局穩定,claude-opus-5-max 以 1692 分蟬聯第一,國產 kimi-k3-max 以 1674 分保持第二名位置,僅落後 18 分,依然對榜首形成緊逼。阿里 qwen3.8-max 上升 1 位至第三名,ELO 分數 1667 分,深度求索的 deepseek-v4-pro-high-20260813 作為新模型首次入榜即拿到第 10 名,ELO 分數 1584 分,表現不俗。

國產模型在前端開發榜佔據多個頭部和中上游位置,具體如下:月之暗面 kimi-k3-max 位列第 2 名,ELO 1674 分,排名不變;阿里 qwen3.8-max 位列第 3 名,ELO 1667 分,較上週上升 1 位;智譜 glm-5.2-max 位列第 9 名,ELO 1585 分,較上週下降 2 位;深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名,ELO 1584 分;深度求索 deepseek-v4-flash-high 位列第 11 名,ELO 1581 分,排名下降 3 位。

排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-opus-5-maxAnthropic1692 ±96448$5 / $251M2-kimi-k3-maxMoonshot1674 ±114546$3 / $151.05M3↑ 1qwen3.8-maxAlibaba1667 ±132855$2 / $61M4↓ 1claude-opus-5-highAnthropic1663 ±97334$5 / $251M5新上榜grok-4.

6-highSpaceXAI1631 ±171513$2 / $6500K6↓ 1claude-fable-5Anthropic1627 ±87867$10 / $501M7↓ 1gpt-5.6-sol-xhigh(codex-harness)OpenAI1622 ±88595$5 / $301.05M8新上榜gemini-3.7-flash-highGoogle1587 ±132543$0.75 / $3.571.05M9↓ 2glm-5.2-maxZ.ai1585 ±88142$1.4 / $4.

41M10新上榜deepseek-v4-pro-high-20260813DeepSeek1584 ±142180N/AN/A— 以下為 Top 10 外的國產模型 —11↓ 3deepseek-v4-flash-highDeepSeek1581 ±122936$0.44 / $1.321.05M24-hy3Tencent1522 ±132284$0.13 / $0.53262.1K25↓ 4seed-2.1-pro-previewBytedance1522 ±87121N/AN/A27↓ 2qwen3.7-max-20260517Alibaba1517 ±88373$1.48 / $4.

431M29↓ 3glm-5.1Z.ai1510 ±78817$1.4 / $4.4202.8K30↓ 3kimi-k2.6Moonshot1509 ±79589$0.95 / $4262.1KAI 生圖榜AI 生圖榜中,gpt-image-2 (medium) 以 1381 分繼續穩坐榜首,微軟新模型 mai-image-2.6-preview 首次入榜就拿到第二名,ELO 分數 1336 分,直接躋身頭部梯隊。國產 seedream-5.0-pro 守住第八名,ELO 分數 1258 分,qwen-image-3.0-pro 位列第九名,兩者分數差距僅 1 分,在誤差範圍內並列。

排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-gpt-image-2 (medium)OpenAI1381 ±570065N/AN/A2新上榜mai-image-2.6-previewMicrosoft AI1336 ±113488N/AN/A3↓ 1grok-imagine-image-2.0 (low)SpaceXAI1316 ±122676N/AN/A4↓ 1reve-2.1Reve1302 ±87588N/AN/A5↓ 1muse-imageMeta1282 ±715119N/AN/A6↓ 1reve-2.

0Reve1270 ±614641N/AN/A7↓ 1gemini-3.1-flash-image(nano-banana-2) [web-search]Google1264 ±529102N/AN/A8-seedream-5.0-proBytedance1258 ±528830N/AN/A9↓ 2qwen-image-3.0-proAlibaba1257 ±94705N/AN/A10↓ 1mai-image-2.5Microsoft AI1256 ±446329N/AN/A— 以下為 Top 10 外的國產模型 —17↓ 1qwen-image-2.

0-pro-2026-06-22Alibaba1191 ±612021N/AN/A30↓ 1hunyuan-image-3.0Tencent1151 ±3173345N/AN/AAI 視頻榜AI 視頻榜頭部迎來新變化,Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名,ELO 分數 1496 分,僅落後榜首 gemini-omni-flash 16 分。國產模型 dreamina-seedance-2.0-720p 保持第三名位置,ELO 分數 1478 分,minimax-h3 位列第五名,整體頭部格局相對穩定。

排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-gemini-omni-flashGoogle1512 ±1115930N/AN/A2新上榜flux-3-videoBlack Forest Labs1496 ±171288N/AN/A3↓ 1dreamina-seedance-2.0-720pBytedance1478 ±948355N/AN/A4↓ 1muse-videoMeta1457 ±152176N/AN/A5↓ 1minimax-h3MiniMax1453 ±142192N/AN/A6↓ 1happyhorse-1.

0Alibaba-ATH1428 ±1322117N/AN/A7↓ 1sora-2-proOpenAI1366 ±745731$0 / $0.3N/A8↓ 1veo-3.1-audioGoogle1364 ±1413743$0 / $0.4N/A9↓ 1veo-3.1-audio-1080pGoogle1363 ±1024981N/AN/A10↓ 1veo-3.1-fast-audioGoogle1362 ±1039441$0 / $0.15N/A— 以下為 Top 10 外的國產模型 —14↓ 1wan2.7-t2vAlibaba1343 ±816757N/AN/A17↓ 1wan2.

6-t2vAlibaba1333 ±843230N/AN/A18↓ 1seedance-v1.5-proBytedance1256 ±776001N/AN/A20↓ 1wan2.5-t2v-previewAlibaba1249 ±927361N/AN/A29↓ 1hailuo-2.3MiniMax1203 ±674338N/AN/A30↓ 1hailuo-02-proMiniMax1198 ±129392N/AN/A智能體榜智能體榜中,Anthropic 模型繼續壟斷前三,Claude Opus 5 (High) 以 12.19% 的淨提升度守住榜首位置。

本次榜單有兩款新模型進入前十,其中國產 Qwen3.8 Max 首次入榜即排名第 11 位,淨提升度達到 7.61%,任務確認成功率 12.54%,工具幻覺率僅 0.11%,表現非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六,淨提升度 9.78%。國產 Kimi K3 (Max) 穩定在第五名,淨提升度 10.6%,任務確認成功率 15.55%,已經躋身全球智能體第一梯隊。國產模型在智能體榜已有多款進入中上游,具體如下:月之暗面 Kimi K3 (Max) 位列第 5 名,淨提升度 10.60%,任務確認成功率 15.55%,排名不變;阿里 Qwen3.

8 Max 新入榜位列第 11 名,淨提升度 7.61%,任務確認成功率 12.54%;智譜 GLM 5.2 (Max) 位列第 14 名,淨提升度 6.74%,較上週下降 2 位;深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名,淨提升度 4.04%,較上週上升 2 位。排名較上週模型廠商淨提升度 (±CI)任務確認成功率好評 / 差評比可控性1-Claude Opus 5 (High)Anthropic12.19% ±1.45%15.35% ±3.03%19.26% ±5.29%11.34% ±2.

79%2-Claude Fable 5 (High)Anthropic12.01% ±2.57%10.66% ±4.9%25.14% ±9.01%8.84% ±5.23%3-Claude Opus 5 (Max)Anthropic11.95% ±1.71%17.96% ±3.18%19.3% ±6.26%6.95% ±3.43%4-GPT 5.6 Sol (xHigh)OpenAI10.86% ±1.8%10.12% ±3.69%23.03% ±6.72%9.23% ±3.74%5-Kimi K3 (Max)Moonshot10.6% ±1.04%15.55% ±2.06%20.31% ±3.

78%7.8% ±1.91%6新上榜Claude Opus 4.8 (High)Anthropic9.78% ±1.78%9.45% ±3.1%22.52% ±5.71%8.44% ±3.33%7-GPT 5.5 (xHigh)OpenAI8.9% ±1.03%4.97% ±2.18%14.61% ±3.62%9.17% ±1.92%8新上榜Claude Opus 4.7 (High)Anthropic8.17% ±1.43%6.61% ±2.95%12.32% ±4.81%7.72% ±2.91%9↑ 2GPT 5.5 (High)OpenAI7.73% ±0.97%4.03% ±2.

04%11.62% ±3.39%8.59% ±1.79%10-Claude Opus 4.7Anthropic7.66% ±1.45%5.45% ±3.08%11.57% ±4.71%9.95% ±2.87%— 以下為 Top 10 外的國產模型 —11新上榜Qwen3.8 MaxAlibaba7.61% ±1.6%12.54% ±3.32%11.64% ±5.58%5.34% ±3.09%14↓ 2GLM 5.2 (Max)Z.ai6.74% ±0.9%8.39% ±1.91%11.6% ±3.18%6.14% ±1.

58%19↑ 2Deepseek V4 Flash (High)(20260731)DeepSeek4.04% ±0.81%8.7% ±1.93%2.46% ±2.71%3.34% ±1.57%25↓ 2Kimi K2.7 CodeMoonshot1.08% ±2.15%4.43% ±4.55%2.74% ±7.27%1.76% ±4.86%26↓ 2GLM 5.1Z.ai0.58% ±0.82%1.75% ±1.82%0.84% ±2.56%1.73% ±1.48%27↓ 2Qwen3.7 MaxAlibaba0.2% ±0.87%0.34% ±2.13%4.24% ±2.67%0.

03% ±1.52%28↓ 2DeepSeek V4 ProDeepSeek0.14% ±0.88%2.16% ±2.21%2.5% ±2.82%0.59% ±1.63%本週 Arena 榜單最顯著的特徵是海外廠商 Anthropic 集中發佈多款新模型並迅速佔據各榜單頭部位置,驗證了其模型迭代的技術積累;國產模型方面,kimi-k3-max 在綜合、代碼、前端開發三個核心榜單均穩定在前 15 名,前端開發榜更是穩居第二,qwen3.8-max 在智能體榜首秀即進入 Top 11,整體來看國產大模型在通用能力和智能體領域都在持續推進,與頭部海外模型的差距仍在穩步縮小。

下週市場預計將有更多國產新模型完成版本迭代,值得持續關注其排名表現。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI 大模型,qwen3.8max,kimik3max,claudeopus46high,deepseekv4prohigh20260813韶音 OpenFit 2 AI 耳機開啟預售:基於千問大模型、48 小時續航,首發價 1398 元李開復:中國開源大模型讓美國人很擔憂AI 大模型周榜:阿里 qwen3.

8-max 衝進綜合榜 Top 6,國產多模型表現亮眼消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成北京一酒吧上線“不限量免費 Token”服務,到店連接 Wi-Fi 即可暢用 DeepSeek V4 Flash 模型中美 AI 大模型競爭加劇:OpenAI 等海外巨頭大幅降價對標 Kimi、DeepSeek

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛