AI 大模型周榜:國產 Kimi K3 首次殺入綜合榜 Top 10,登頂前端開發榜

重點摘要
首頁 > 智能時代>人工智能 AI 大模型周榜:國產 Kimi K3 首次殺入綜合榜 Top 10,登頂前端開發榜 2026/7/20 18:38:43 來源:IT之家 作者:小泵 責編:小泵 評論: IT之家 7 月 20 日消息,Arena(arena.ai)平臺發佈了 2026-29 期大模型排行榜,統計週期為 2026 年 7 月 13 日 ~2026 年 7 月 19 日。
AI 大模型權威評測平台 Arena(arena.ai)於 7 月 20 日發布 2026 年第 29 期大模型排行榜,統計區間為 7 月 13 日至 7 月 19 日。本期榜單迎來大批新模型集中入榜,其中最受矚目的莫過於國產模型 kimi-k3 的突出表現:它不僅首次殺入綜合能力 Top 10,更直接登頂前端開發榜榜首,在特定細分領域實現了對多數海外頭部模型的反超。整體來看,多家國產模型在多個榜單的前列站穩腳跟,大陸 AI 陣營的梯隊完整度進一步提升。 在綜合榜方面,頭部位置主要由 Claude、Meta、Google、OpenAI 等廠商的新模型主導。第一名依然由 Anthropic 的 claude-fable-5 佔據,ELO 分數為 1507 分。Anthropic 旗下多款思考版本模型集中入駐前五名,彼此之間分差全部在 15 分以內,在誤差範圍內屬於並列第一梯隊。本週最大亮點是國產模型 kimi-k3 憑藉 1486 分 ELO 排名第九,首次躋身綜合榜前十,與第八名的 gemini-3-pro、第十名的 gpt-5.6-sol-xhigh 分數完全一致,處於第一梯隊邊緣位置。其他國產模型在綜合榜中上游表現穩定:阿里 qwen3.7-max-preview 排名第十八,ELO 1475 分;智譜 glm-5.1 排名第二十七,ELO 1471 分;智譜 glm-5.2 (max) 排名第三十,ELO 1468 分。 在代碼榜方面,榜首位置發生變動。claude-opus-4-7-thinking 從第二名升至第一名,ELO 分數 1553 分,將此前排名第一的 claude-fable-5 擠到第二名,後者分數降至 1551 分,兩者僅有 2 分差距,屬於並列第一梯隊。Anthropic 的多款思考模型幾乎包攬前七名,整體統治力依然強勁。國產模型 kimi-k3 首次進入代碼榜前十,排名第十,ELO 1529 分,與第九名僅差 1 分,表現相當接近第一梯隊。其他國產模型在代碼榜覆蓋多段位梯隊:阿里 qwen3.7-max-preview 排名第十二,ELO 1527 分;智譜 glm-5.1 排名第十七,ELO 1521 分;小米 mimo-v2.5-pro 排名第二十四,ELO 1518 分;月之暗面 kimi-k2.6 排名第二十六,ELO 1515 分;百度 ernie-5.1 排名第二十七,ELO 1514 分。 前端開發榜呈現出前所未有的格局。國產模型 kimi-k3 直接以 1679 分的高 ELO 穩居第一名,大幅領先第二名 claude-fable-5 的 1631 分,分差達到 48 分,優勢極為明顯。第四名同樣由國產模型 glm-5.2 (max) 拿下,ELO 1587 分,超過了多款 Claude、OpenAI 的旗艦模型。這意味著國產大模型在前端開發這一細分場景的能力已經走在全球最前列。其他國產模型在前端開發榜佔據頭部與中上游位置:字節跳動 seed-2.1-pro-preview 排名第十四,ELO 1534 分,首次入駐榜單前半區;智譜 glm-5.1 排名第十五,ELO 1526 分;阿里 qwen3.7-max-20260517 排名第十七,ELO 1516 分;月之暗面 kimi-k2.6 排名第十八,ELO 1515 分。 智能體榜本週全部為全新入榜模型。排名第一的是 Claude Fable 5 (High),淨提升度 13.94%,同時擁有 30.65% 的最高好評/差評比,工具幻覺率僅 1.33%。第二名 GPT 5.6 Sol (xHigh) 的可控性數值最高,達到 17.26%。頭部三款模型的淨提升度差距明顯大於各自的置信區間,屬於表現分層的清晰格局。國產模型 GLM 5.2 (Max) 殺入榜單前十,位列第九,淨提升度為 6.24%,其 Bash 恢復速度僅 4.45,遠好於頭部平均水平,命令出錯後能快速恢復,表現突出。其他國產模型在智能體榜覆蓋靠前和中間位置,工具相關能力表現亮眼:智譜 glm-5.1 排名第十六,淨提升度 1.19%;阿里 qwen3.7 Plus 排名第十八,淨提升度 0.61%,工具幻覺率僅 0.19%;月之暗面 kimi-k2.7-code 排名第二十,淨提升度 0.76%;阿里 qwen3.7 Max 排名第二十一,淨提升度 0.81%;深度求索 deepseek-v4-pro 排名第二十二,淨提升度 1.11%。 在 AI 生圖榜方面,本週整體格局穩定。OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 穩居第一,字節跳動 seedream-5.0-pro 作為最高排名的國產模型位列第十一,ELO 1231 分,緊隨多款海外頭部生圖模型之後。而在 AI 視頻榜,Google gemini-omni-flash 位列榜首;字節跳動的 dreamina-seedance-2.0-720p 穩居第二名,ELO 分數 1482 分,表現遠超多數海外視頻生成模型;同時阿里 happyhorse-1.0 也拿下第四名,顯示國產力量在 AI 視頻生成第一梯隊已經佔據重要席位。 本週 Arena 榜單的最大亮點在於國產模型的多點突破,尤其是 kimi-k3 首次衝進綜合榜前十,並且直接登頂前端開發榜,證明國產大模型不僅在通用能力上追平第一梯隊,在特定工程類任務場景已經形成領先優勢。同時字節跳動、阿里、智譜等廠商的多款模型也在代碼、生圖、視頻、智能體等多個榜單的前半區站穩腳跟。隨著更多用戶評測數據進一步積累,部分新入榜模型的排名與分數還可能出現小幅變動,後續國產模型能否在更多細分榜單拿下榜首位置,值得持續關注。
Related
相關文章

三萬步爆走WAIC:300多臺機器人同臺“打工”
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作三萬步爆走WAIC:300多臺機器人同臺“打工”節點財經·2026年07月21日 10:33從臺上的“舞蹈明星”,到工廠裡的“狠人打工仔” 如果你也是在今年7月的上海,頂著黃浦江畔近35度的高溫踏進WAIC展館,你大概會產生和我一模一樣的生理體驗:電梯排隊排到懷疑人生,展臺擠得腳不著地,手機信號在密集的人潮與各種無線設備幹擾下時好時壞,步數輕輕鬆鬆衝破兩萬步。 這屆大會有多火爆? 原價168元的普通票,甚至被炒到了2000元。這應該是WAIC史上最火的一年。 但更直接的,是機器人賽道的熱鬧——從H3館綿延到徐匯西岸,200多家機器人企業、300多臺真機就在你眼皮子底下同臺運轉。 這無疑是WAIC舉辦以來最火爆的一屆。但只要你在現場多貓一會兒,就會發現今年機器人的“畫風”徹底變了。 H3館擠爆了!200多家機器人把你看“飽”了 走到世博展覽館,你才能切身體會什麼叫“AI集市”。今年WAIC乾脆搞了個“三地四館”的大場面,分工極其明確:H1看智能體大模型,H2拼底層算力,H3全留給機器人,H4則是初創團隊的擂臺。 走到H1和H2,氛圍就已經拉滿了。H1館裡,MiniMax M3、無問芯穹的脫敏智能體各顯神通,Kimi甚

AI應用WAIC“搶跑”:熱鬧是真,但差異化是假
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作AI應用WAIC“搶跑”:熱鬧是真,但差異化是假光錐智能·2026年07月21日 10:30沒人能精準預判下一個爆款,但誰也不願錯過任何可能。 今年逛WAIC在精神上是享受,在肉體上是遭罪。 展館內隨處可見超大冰塊、熱到拿手中一摞宣傳單扇風的觀眾,和架著長槍短炮、一字排開坐在角落的工作人員。每個人臉上都寫滿了疲倦。 這屆展覽總面積首次突破10萬平方米,首次把論壇和展覽拆到了不同的場館。這場盛大的展覽,是大廠、小廠、創業者同時加速湧入AI行業帶來的“繁榮”。 時代在切換,一些參與者多了,另一些參與者在退場。 去年本來就退居角落的大模型,今年在展館裡更是難以尋覓。取而代之的,是隨處可見的智能體(Agent)產品,是排成長隊的“AI智能體手機”,是各家反覆宣傳的“行業大腦”與“數字員工”。 在逛展結束之後,光錐智能從今年WAIC感受到幾個清晰的信號: 模型不再值得一個展臺,聚光燈從參數轉向了場景。C端忙著做Agent搶佔市場先機,B端忙著做智能體平臺,或是靠FDE(Forward Deployed Engineer,駐場部署工程師)挖掘企業轉型的機會。 智能體百花齊放,AI硬件也不遑多讓。場館幾乎每個展臺都在宣傳智能體。

Work Buddy續命,但不能幫騰訊拿到AI船票
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作Work Buddy續命,但不能幫騰訊拿到AI船票競合人工智能·2026年07月21日 10:30向來不是擅長掌握B端火候的廚師。 真正的顛覆者,永遠是手握底層系統、獨佔生態、掌握頂級模型的玩家。 01 一隻龍蝦的野心 2026年夏天的深圳濱海大廈,騰訊某間會議室裡,產品經理李明(化名)正對著一塊白板比劃。白板上畫著一隻藍色的龍蝦,旁邊潦草地寫著幾個詞:“大模型聚合”“工作流”“企業智能體”。這是騰訊內部代號“Work Buddy”的新產品——一隻被寄予厚望的“龍蝦”。 “我們要讓這隻龍蝦爬進每一家企業的辦公桌。”李明對在場的十幾位高管說。他的PPT翻到下一頁,一行加粗的字跳出來:“基於騰訊雲,打造中國最強的AI工作流平臺。” 會議室裡有人點頭,有人皺眉。點頭的人看到了一個機會:騰訊終於要在企業級AI市場亮劍了。皺眉的人則想起了騰訊雲這些年的尷尬——它就像騰訊帝國裡那個沉默的次子,遊戲和微信在前面風光無限,雲業務在後面悶聲不響,偶爾被提起,也總是在阿里雲、華為雲甚至金山雲的陰影裡。 但2026年的騰訊,似乎不想再沉默了。大模型浪潮席捲而來,阿里雲有通義千問,華為雲有盤古,百度有文心一言,字節有豆包。騰訊呢?它有混元

龍蝦之父一條推文,Loop 時代終結?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作龍蝦之父一條推文,Loop 時代終結?極客邦科技InfoQ·2026年07月21日 10:26“我們還在討論循環,還是已經轉向圖了?” “我們還在討論循環,還是已經轉向圖了?” 2026 年 7 月 18 日,Peter Steinberger 在 X 平臺上用這一句話,悄然宣告了循環工程時代的終結。這條帖子在發佈後的兩天內獲得了 260 萬瀏覽。 六週前,他用“設計能提示 Agent 的循環”獲得了 840 萬瀏覽,讓全球開發者意識到提示工程的時代正在過去,循環工程才是新的方向。 兩條帖子,累計瀏覽量超過 1100 萬次,把 AI 編程領域最熱門的討論推向了下一個節點。 循環的崛起 過去一個月,“Loop Engineering(循環工程)”迅速成為 AI 編程領域的熱門概念。 但它真正的起源,要追溯到一年前。2025 年 7 月,軟件工程師 Geoffrey Huntley 提出了一種被他稱作“Ralph”的方法——一個簡單的 Bash 循環,讓 Claude 反覆執行任務直到目標達成: while :; do cat PROMPT.md | claude-code ; done Ralph 方法的核心在於繞過

Alphabet 把 Gemini 刻進了硅片
Alphabet 把 Gemini 刻進了硅片AGI-Signal2026.07.21 10:17 · 來自海外全文2992字00:00 / 08:30推理效率比現有TPU提升6至10倍。AI 芯片的競爭正在進入一個新階段。芯片開始反過來適配模型,而且是隻為單一模型定製。

把張益唐坑苦的雅可比猜想,被Fable 5證偽了?
# 利用Claude Fable 5,數學家推翻困擾學界85年的雅可比猜想 一條推文,一個反例,一篇僅有幾行多項式的論文,讓困擾代數幾何學界長達85年的雅可比猜想瞬間崩塌。Anthropic 的數學家 Levent Alpoge 在社交平台 X 上宣布,他與芝加哥大學代數幾何學家 Akhil Mathew 聯手,藉助自家大模型 Claude Fable 5,找到了一個令猜想無法成立的反例。這則消息在數小時內引爆全球數學圈,瀏覽量迅速突破五百萬,被形容為「AI 參與數學發現的歷史性時刻」。