AI 大模型周榜:阿里 qwen3.8-max 衝進綜合榜 Top 6,國產多模型表現亮眼

作者:小泵 責編:小泵 評論: 8 月 10 日消息,Arena(arena.ai)平臺發佈 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲測排名,本週共有多款新模型入榜,其中國產模型阿里 qwen3.8-max 表現突出,殺入綜合榜第 6 名,ELO 分數達到 1497 分,整體處於頭部梯隊。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列綜合榜第 4 名,成為海外陣營的亮眼新秀。本週多個細分榜單都有新模型亮相,國產模型在前端開發、代碼、生圖等領域均實現突破。注:本榜單基於 Arena(arena.
ai)平臺匿名盲測投票,通過 ELO(智能體榜為百分比信號)計算排名,反映用戶主觀偏好而非絕對能力測試;不同分榜相互獨立,不宜跨榜比較,分差在誤差範圍內均視為並列,新模型也需積累一定投票量後才會正式入榜。綜合榜本週綜合榜頭部格局相對穩定,Anthropic 旗下 claude-fable-5 依舊佔據榜首位置,ELO 分數為 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 緊隨其後位列第二、三名,三者分差均在 10 分以內,在誤差範圍內視為接近。本週最大看點是兩款新模型強勢闖入頭部:Meta 新發布的 muse-spark-1.
2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,與第 5 名的 claude-opus-4-6 同分,僅因置信區間差異排名靠後,同樣在統計誤差範圍內並列。頭部整體分數密集,前 10 名分數均在 1488 分以上,競爭極為激烈。國產模型在綜合榜已有多款進入中上游,具體排名如下:阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;阿里 qwen3.
7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-fable-5Anthropic1507 ±619390$10 / $501M2-claude-opus-4-6-thinkingAnthropic1505 ±469336$2.5 / $12.51M3-claude-opus-4-7-thinkingAnthropic1502 ±457018$5 / $251M4新上榜muse-spark-1.2 (xHigh)Meta1498 ±132057$1.25 / $4.
25N/A5↓ 1claude-opus-4-6Anthropic1497 ±373158$2.5 / $12.51M6新上榜qwen3.
8-maxAlibaba1497 ±94662$2 / $61M7↓ 2claude-opus-4-7Anthropic1493 ±458135$5 / $251M8↓ 2claude-opus-5-highAnthropic1493 ±614902$5 / $251M9↓ 2claude-opus-5-maxAnthropic1488 ±87137$5 / $251M10↓ 1muse-sparkMeta1488 ±613476N/AN/A— 以下為 Top 10 外的國產模型 —14↓ 2kimi-k3-maxMoonshot1485 ±79861N/AN/A23↓ 2qwen3.
7-max-previewAlibaba1475 ±103695$1.48 / $4.431M代碼榜代碼榜頭部依舊被 Anthropic 模型壟斷,claude-fable-5 蟬聯第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分別佔據第二、三名。月之暗面 kimi-k3-max 本週排名從第 8 位上升至第 6 位,ELO 分數上漲 11 分至 1542 分,闖入 Top 6,成為代碼榜排名最高的國產模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同樣進入前十。
Meta muse-spark-1.2 (xHigh) 本週首次入榜排名第 15,ELO 1526 分。國產模型在代碼榜已有多款進入前 30,具體如下:月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,較上週上升 2 位;阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;智譜 glm-5.1 排名第 30 名,ELO 1517 分,較上週下降 3 位。
排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-fable-5Anthropic1553 ±95234$10 / $501M2-claude-opus-4-7-thinkingAnthropic1552 ±616303$5 / $251M3-claude-opus-4-6-thinkingAnthropic1551 ±618015$2.5 / $12.51M4-claude-opus-4-6Anthropic1547 ±620444$2.5 / $12.
51M5-claude-opus-4-7Anthropic1546 ±616534$5 / $251M6↑ 2kimi-k3-maxMoonshot1542 ±122611N/AN/A7↓ 1claude-opus-4-8-thinkingAnthropic1535 ±710509$2.5 / $12.51M8新上榜qwen3.8-maxAlibaba1532 ±161411$2 / $61M9↑ 1muse-spark-1.1Meta1532 ±104199$1.25 / $4.
25N/A10↓ 1claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77603$5 / $25200K— 以下為 Top 10 外的國產模型 —17↓ 1qwen3.7-max-previewAlibaba1526 ±181112$1.48 / $4.431M28-mimo-v2.5-proXiaomi1519 ±713199$0.44 / $0.871.05M30↓ 3glm-5.1Z.ai1517 ±710330$1.4 / $4.4202.
8K前端開發榜本週前端開發榜榜首依舊是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 穩定保持第二位,ELO 1675 分,僅下跌 1 分,仍緊逼頭部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接進入前五,表現十分搶眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。國產模型在前端開發榜已經佔據多個 top10 位置,整體競爭力持續提升。國產模型具體排名如下:月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;阿里 qwen3.
8-max 排名第 4 名,ELO 1667 分;智譜 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-claude-opus-5-maxAnthropic1686 ±114029$5 / $251M2-kimi-k3-maxMoonshot1675 ±124372$3 / $151.
05M3-claude-opus-5-highAnthropic1670 ±105145$5 / $251M4新上榜qwen3.8-maxAlibaba1667 ±161980$2 / $61M5↓ 1claude-fable-5Anthropic1630 ±96816$10 / $501M6↓ 1gpt-5.6-sol-xhigh(codex-harness)OpenAI1620 ±96903$5 / $301.05M7↓ 1glm-5.2-maxZ.ai1588 ±96924$1.4 / $4.
41M8新上榜deepseek-v4-flash-highDeepSeek1581 ±151931$0.14 / $0.281.05M9↓ 1claude-opus-4-8-thinkingAnthropic1565 ±89549$2.5 / $12.51M10↓ 1claude-opus-4-7Anthropic1560 ±712398$5 / $251M— 以下為 Top 10 外的國產模型 —21↓ 3seed-2.1-pro-previewBytedance1524 ±96069N/AN/A24↓ 1hy3Tencent1522 ±151729$0.13 / $0.53262.
1K25↓ 3qwen3.7-max-20260517Alibaba1516 ±88044$1.48 / $4.431M26↓ 2glm-5.1Z.ai1515 ±87853$1.4 / $4.4202.8K27↓ 2kimi-k2.6Moonshot1510 ±89261$0.95 / $4262.1K智能體榜智能體榜本週頭部發生更替,Anthropic Claude Opus 5 (High) 從第三名上升至第一名,淨提升度達到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,淨提升度 11.66%,兩者淨提升度差距小於雙方置信區間之和,在誤差範圍內視為並列。
國產模型月之暗面 Kimi K3 (Max) 穩定保持第五名,淨提升度 10.08%,任務確認成功率達到 14.97%,已經躋身智能體榜第一梯隊。深度求索 Deepseek V4 Flash (High) (20260731) 本週首次入榜排名第 21,淨提升度 2.84%,任務確認成功率達到 8.53%,首秀表現符合預期。國產模型在智能體榜已有多款進入前 30,具體如下:月之暗面 Kimi K3 (Max) 排名第 5 名,淨提升度 10.08%,任務確認成功率 14.97%,排名持平;智譜 GLM 5.2 (Max) 排名第 12 名,淨提升度 6.
75%,排名持平;深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,淨提升度 2.84%,首次入榜;智譜 GLM 5.1 排名第 24 名,淨提升度 0.35%,排名下降 2 位。排名較上週模型廠商淨提升度 (±CI)任務確認成功率好評 / 差評比可控性1↑ 2Claude Opus 5 (High)Anthropic11.99% ±1.37%16.04% ±2.79%19.46% ±5.19%10.29% ±2.51%2↓ 1Claude Fable 5 (High)Anthropic11.66% ±2.39%11.47% ±4.46%22.
56% ±8.25%10.01% ±4.93%3↓ 1Claude Opus 5 (Max)Anthropic11.19% ±1.62%16.36% ±3.11%19.07% ±6.03%5.8% ±3.1%4-GPT 5.6 Sol (xHigh)OpenAI10.28% ±1.72%9.06% ±3.48%22.7% ±6.42%8.42% ±3.5%5-Kimi K3 (Max)Moonshot10.08% ±1.07%14.97% ±2.09%19.68% ±3.85%7.45% ±1.97%6-Claude Opus 4.8 (Thinking)Anthropic9.35% ±1.
7%8.81% ±2.9%21.46% ±5.38%8.5% ±3.08%7↑ 1GPT 5.5 (xHigh)OpenAI8.45% ±0.99%5.24% ±2.08%13.56% ±3.55%8.19% ±1.8%8↑ 1Claude Opus 4.7 (Thinking)Anthropic8.33% ±1.32%6.65% ±2.76%11.87% ±4.59%8.61% ±2.72%9↓ 2Claude Sonnet 5 (High)Anthropic7.46% ±2.15%5.56% ±4.29%14.8% ±7.65%5.14% ±4.55%10↑ 1Claude Opus 4.
7Anthropic7.32% ±1.36%5.55% ±2.85%10.72% ±4.45%9.54% ±2.7%— 以下為 Top 10 外的國產模型 —12-GLM 5.2 (Max)Z.ai6.75% ±0.9%9.21% ±1.83%12.39% ±3.21%5.62% ±1.59%21新上榜Deepseek V4 Flash (High)(20260731)DeepSeek2.84% ±1.1%8.53% ±2.54%0.46% ±3.64%0.43% ±2.19%23-Kimi K2.7 CodeMoonshot0.69% ±1.94%4.12% ±4.08%2.36% ±6.
68%1.92% ±4.37%24↓ 2GLM 5.1Z.ai0.35% ±0.77%1.06% ±1.72%0.72% ±2.5%0.76% ±1.4%25-Qwen3.7 MaxAlibaba0.16% ±0.88%0.24% ±2.11%5.07% ±2.72%0.21% ±1.55%26-DeepSeek V4 ProDeepSeek0.33% ±0.86%2.74% ±2.16%3.35% ±2.78%0.3% ±1.54%27↑ 2Kimi K2.6Moonshot0.48% ±2.16%2.28% ±4.11%2.12% ±6.8%1.66% ±4.
49%30↓ 3Hy3Tencent1.12% ±1.42%2.2% ±3.04%3.7% ±4.91%9.01% ±2.6%AI 生圖榜本週 AI 生圖榜頭部依舊是 OpenAI gpt-image-2 (medium) 佔據第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表現出色。國產方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字節跳動 seedream-5.
0-pro 排名第八,ELO 1257 分,兩款國產模型均進入前十,整體處於第一梯隊。騰訊 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表現穩定。排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-gpt-image-2 (medium)OpenAI1380 ±569194N/AN/A2新上榜grok-imagine-image-2.0 (low)SpaceXAI1320 ±122722N/AN/A3↓ 1reve-2.
1Reve1302 ±87598N/AN/A4↓ 1muse-imageMeta1283 ±714510N/AN/A5↓ 1reve-2.0Reve1270 ±614650N/AN/A6↓ 1gemini-3.1-flash-image(nano-banana-2) [web-search]Google1263 ±527910N/AN/A7新上榜qwen-image-3.0-proAlibaba1258 ±103735N/AN/A8↓ 2seedream-5.0-proBytedance1257 ±526510N/AN/A9↓ 2mai-image-2.
5Microsoft AI1256 ±544940N/AN/A10↓ 2gemini-3.1-flash-lite-image(nano-banana-2-lite)Google1251 ±616419N/AN/A— 以下為 Top 10 外的國產模型 —16↓ 2qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612026N/AN/A29↓ 4hunyuan-image-3.
0Tencent1151 ±3173366N/AN/AAI 視頻榜AI 視頻榜頭部格局穩定,谷歌 gemini-omni-flash 依舊佔據榜首,ELO 1513 分,字節跳動 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距僅 34 分,接近頭部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闖入前五,成為國產 AI 視頻模型的最新亮點。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同樣保持穩定,國產模型已經佔據榜單前五中的三個席位,優勢明顯。
排名較上週模型廠商分數 (±CI)票數價格 ($/M)輸入 / 輸出上下文1-gemini-omni-flashGoogle1513 ±1214571N/AN/A2-dreamina-seedance-2.0-720pBytedance1479 ±1147067N/AN/A3-muse-videoMeta1458 ±152160N/AN/A4新上榜minimax-h3MiniMax1455 ±191060N/AN/A5↓ 1happyhorse-1.0Alibaba-ATH1428 ±1321979N/AN/A6↓ 1sora-2-proOpenAI1365 ±844543$0 / $0.
3N/A7-veo-3.1-audioGoogle1364 ±1413687$0 / $0.4N/A8↓ 2veo-3.1-audio-1080pGoogle1363 ±1024846N/AN/A9↓ 1veo-3.1-fast-audioGoogle1362 ±1139301$0 / $0.15N/A10↓ 1veo-3.1-fast-audio-1080pGoogle1358 ±1025637N/AN/A— 以下為 Top 10 外的國產模型 —13↓ 2wan2.7-t2vAlibaba1347 ±915246N/AN/A16↓ 1wan2.
6-t2vAlibaba1330 ±941706N/AN/A17↓ 1seedance-v1.5-proBytedance1256 ±775653N/AN/A19↓ 2wan2.5-t2v-previewAlibaba1252 ±1025895N/AN/A28↓ 1hailuo-2.
3MiniMax1202 ±772127N/AN/A29↓ 1hailuo-02-proMiniMax1198 ±139365N/AN/A30↓ 1seedance-v1-proBytedance1190 ±1112117N/AN/A本週 Arena 周榜迎來多款重量級新模型,國產大模型在綜合、代碼、前端開發、生圖、視頻等多個維度均實現突破,阿里 qwen3.8-max 首秀即殺入頭部梯隊,證明國產大模型綜合能力已經接近國際第一梯隊水平,多個細分領域國產模型已經佔據領先位置。下週預計將有更多新模型完成測試入榜,我們也將持續關注排名變化。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI 大模型,qwen3.8max,kimik3max,musespark1.2消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成北京一酒吧上線“不限量免費 Token”服務,到店連接 Wi-Fi 即可暢用 DeepSeek V4 Flash 模型中美 AI 大模型競爭加劇:OpenAI 等海外巨頭大幅降價對標 Kimi、DeepSeekAI 大模型周榜:阿里千問 3.8-Max 空降綜合前五,字節即夢 5.0 生圖第六阿里巴巴千問 Qwen3.8-Max 模型正式上線,總參數量 2.
4 萬億長三角(嘉興)Token 運營中心啟動,DeepSeek、千問等 100 餘款大模型可選
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。