IT之家生成式AI

AI 大模型周榜:代碼榜榜首易主,claude-opus-4-7-thinking 登頂

2026年7月14日 09:44
AI 大模型周榜:代碼榜榜首易主,claude-opus-4-7-thinking 登頂

重點摘要

首頁 > 智能時代>人工智能 AI 大模型周榜:代碼榜榜首易主,claude-opus-4-7-thinking 登頂 2026/7/14 9:44:58 來源:IT之家 作者:小泵 責編:小泵 評論: IT之家 7 月 13 日消息,Arena(arena.ai)平臺發佈了最新一期 AI 大模型周榜,本期覆蓋 2026 年 7 月 6 日 ~2026 年 7 月 12 日。

站內 AI 整理稿

AI 大模型評測平台 Arena 於近日發布最新一周的榜單,統計區間為 2026 年 7 月 6 日至 7 月 12 日。本週榜單最顯著的變化來自代碼能力排行,原本位居第二的 claude-opus-4-7-thinking 一舉躍升榜首,而前一周的冠軍 claude-fable-5 則大幅滑落至第五名。綜合能力方面,榜首仍由 claude-fable-5 蟬聯,整體來看,Anthropic 推出的模型在多個關鍵榜單中都占據了頭部位置。綜合能力榜方面,前五名全部由 Anthropic 旗下的模型包攬。

claude-fable-5 以 ELO 分數 1505 分繼續穩坐第一位,雖然比上週下降了 4 分,但領先幅度依然足夠。緊隨其後的分別是 claude-opus-4-6-thinking(1504 分)、claude-opus-4-7-thinking(1503 分)、claude-opus-4-6(1498 分)以及 claude-opus-4-7(1494 分)。這五款模型的分數差距都在 30 分以內,在統計誤差範圍內可視為並列水準。排名第六的 muse-spark-1.1 較上週下降一位,其餘頭部廠商的模型排名變動不大。

在國產模型的表現方面,綜合能力榜前 30 名中僅有三款中國模型上榜,整體排名與上週大致持平。表現最佳的是阿里旗下 qwen3.7-max-preview,以 1475 分位列第 17 名,排名不變。智譜的 glm-5.1 以 1472 分排在第 25 名,較上週下滑 3 名。百度的 ernie-5.1 則以 1468 分排在第 30 名,排名與前一週相同。代碼能力榜是本次榜單變化最大的領域。原本排名第二的 claude-opus-4-7-thinking 上升一位,以 1553 分的 ELO 分數奪冠。

原本的榜首 claude-fable-5 不僅失去第一,還一口氣跌至第五名,分數從 1563 分降至 1546 分,跌幅達 17 分,變化十分明顯。第二名至第四名分別為 claude-opus-4-6-thinking(1550 分)、claude-opus-4-7(1550 分)、claude-opus-4-6(1547 分),前五名依然全部由 Anthropic 的模型占據,且分數差距在 10 分以內,表現非常接近。值得注意的是,grok-4.5 在本週排名上升 5 位至第 14 名,成為該榜單中漲幅最大的模型之一。國產模型在代碼榜中共有五款入榜。其中 qwen3.

7-max-preview 排名最高,以 1526 分排在第 12 名,較上週下降兩位。智譜的 glm-5.1 以 1521 分排在第 18 名。小米旗下 mimo-v2.5-pro 則以 1518 分排在第 23 名,較上週下滑 6 名。月之暗面的 kimi-k2.6 與百度的 ernie-5.1 雙雙以 1514 分排在第 25 及第 26 名,兩者均較上週上升 3 個名次。智譜另一款模型 glm-5.2 (max) 以 1513 分排在第 27 名,較上週下降 6 名。數學能力榜本週榜首也出現更替。

claude-fable-5 從第二名上升至第一名,ELO 分數大幅提升 31 分達到 1548 分。原榜首 claude-opus-4-6-thinking 則降至第二名,分數維持在 1518 分不變。國產模型中,ernie-5.1 排名上升 2 位至第 14 名,qwen3.7-max-preview 則下降一位至第 11 名,不過分數差距都在誤差範圍內,實際表現差異不大。高難度指令榜方面,頭部同樣出現位置互換。claude-opus-4-6-thinking 從第二名升至榜首,claude-fable-5 則從第一降至第二,但兩者分數同為 1532 分,在統計誤差內可視為並列。

整體榜單變動幅度不超過 3 個名次,格局相對穩定。國產模型部分,qwen3.7-max-preview 排名第 19 位,分數微漲 1 分;glm-5.1 排第 21 名;glm-5.2 (max) 則排在第 30 名,分數無變化。多輪對話能力榜本週變動較為明顯。原本的榜首 claude-fable-5 下跌 3 個名次來到第四名,而 claude-opus-4-7 則上升 1 位成功登頂。muse-spark-1.1 從第 13 名大幅升至第 8 名,是該榜單中漲幅最突出的模型。國產模型 qwen3.7-max-preview 排名第 22 位,分數同樣微漲 1 分。

綜合本週榜單可以發現,Anthropic 的模型在綜合、代碼、數學等多個核心維度依舊占據絕對優勢,特別是頭部前幾名幾乎都由其產品包攬,美國廠商整體在評測中的主導地位仍未動搖。國產模型方面,整體表現穩定於中上游區間,其中阿里 qwen3.7-max-preview 在多個榜單中都保持領先國產模型的位置,展現出持續的競爭力。此外,代碼榜中 kimi-k2.6 與 ernie-5.1 的排名均有上升,顯示部分國產模型在特定能力上正逐步追近。後續新入圍模型的表現,以及國產模型能否進一步挑戰頭部位置,將是值得關注的焦點。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前