鈦媒體生成式AI

毒圈縮圈:AI大模型的“斬殺線”還在上移

2026年8月5日 10:06
毒圈縮圈:AI大模型的“斬殺線”還在上移

重點摘要

AI大模型行業進入殘酷內卷,Agent成為主流應用後,模型競爭轉向任務維度的綜合性價比對決,斬殺線持續上移、毒圈不斷收縮。模型性價比差異被Agent放大,落入斬殺範圍的模型迅速失去市場地位,廠商只能持續降本迭代,無法形成穩固壁壘。

站內 AI 整理稿

AI大模型領域的競爭已進入前所未有的殘酷階段,業界開始用「斬殺線」與「毒圈」這類遊戲術語來形容當前的市場淘汰賽。2026年7月31日,DeepSeek發布了V4 Flash 0731版本,這款模型在Artificial Analysis的Intelligence Index評測中拿下50分,較前一代V4 Flash整整高出10分。若將各家模型放在同一張散點圖上,縱軸代表能力得分,橫軸則是每項任務的平均成本,V4 Flash 0731恰好落在左上角,從它出發向右下方畫出一塊區域——區域內所有模型成本更高、能力卻更弱。

這塊區域被中文AI圈稱為「斬殺線」,落入其中的模型几乎等於被一擊必殺;英文圈則稱之為Kill Zone。而對於那些勉強站在線上的模型來說,威脅還在加速逼近,因為「毒圈」正在不斷縮小。這兩個詞之所以同時在兩岸AI社群中流行,正反映出大模型行業競爭維度的根本轉變:評判標準不再是單輪對話的準確率,而是模型能否有效完成一連串的任務。隨著Agent(智能體)成為主流應用方式,模型的使用場景從一次性的問答變成了需要多步驟協作、調用外部工具、甚至自動重試的複雜任務。單次回答的準確率已無法代表任務最終的成敗,而按token計價的傳統測試也無法反映真實支出。

2026年5月,美國國家標準與技術研究院下屬的CAISI公布了一份DeepSeek V4 Pro與GPT-5.4 mini的對比評估,結果顯示同一對模型在不同任務上的成本差異可以從便宜53%到貴41%——換一組任務,成本高低便完全顛倒。正因如此,Artificial Analysis推出的Intelligence Index v4.1直接以「任務」為核心設計了兩個座標軸。縱軸的能力指數由九項評測加權構成,其中智能體任務佔比最高達34%,其次為編程與科學推理各24%,通用能力僅佔18%。

橫軸的每任務成本則是跑完整套指數的總花費除以任務總數,並按輸入、緩存命中、緩存寫入、推理、回答五類token分別計價。在這一標準下,Claude Opus 4.8 (max) 能力得分56分,但每任務成本高達1.78美元;DeepSeek V4 Pro (max) 得分44分,成本僅0.04美元;而新版V4 Flash 0731得分50分,每任務成本約0.09美元,即便與能力最接近的GPT-5.6 Luna (max)(51分)相比,後者在7月30日大幅降價80%之後,V4 Flash 0731的成本仍低了約60%。散點圖的左上角近乎空白,凸顯了V4 Flash 0731現階段的性價比優勢。

Agent不僅改變了評測方式,也極大放大了模型之間的成本與能力差距。一篇由Bai Longju等人於2026年4月發表的論文《How Do AI Agents Spend Your Money?》分析了八個前沿模型在SWE-bench Verified上的執行軌跡,發現Agent編碼任務的token消耗量是普通代碼問答與推理的一千倍。以官方定價計算,Claude Opus 4.8輸出每百萬token要25美元,而DeepSeek V4 Flash僅0.28美元。一次簡單問答的支出差額僅以美分計,但在一項Intelligence Index任務上,Claude Opus 4.

8 (max) 每任務成本達1.78美元,V4 Flash 0731約0.09美元,差額接近1.7美元。更關鍵的是,Agent任務中消耗的token還在快速增長:Artificial Analysis指出,Claude Sonnet 5的每任務成本已較前代翻倍,增量全部來自用量增加而非單價上漲。同時,能力差距也因任務步驟的串聯而被放大——單輪回答準確率95%與90%只差五個百分點,但二十步之後成功率分別為36%與12%,前者接近後者的三倍;再加上重試機制帶來的額外開銷,能力不足直接轉化為更高的支出。Agent的應用還讓模型的能力評測變得更加複雜。

7月,Reddit的r/LocalLLaMA上有一篇獨立評測,將DeepSeek V4 Flash分別接入Pi、OpenCode、Claude Code、Nanocoder四個不同的Agent框架,執行同一批真實bug修復任務。結果四個框架的能力得分落在同一重疊區間,但消耗的token與時間卻相差四倍。這說明模型只是系統中的一個部件,真正的能力與成本必須放在具體的Agent框架與任務中才能準確衡量。Artificial Analysis為此自建並開源了統一的測試框架Stirrup,所有模型的Intelligence Index跑分都在這個框架內完成,以確保比較的公平性。

大模型市場的切換成本極低,這使得「斬殺線」的殺傷力加倍。API調用標準化、操作協議開放,開發者可以快速在多個模型間切換,用戶甚至不知道底層模型是誰。基礎模型層的進步已明顯放緩,同質化競爭加劇,同一能力檔位的模型只要工程配套完備,切換不會帶來顯著的質量下降。因此,市場份額並非隨性價比差距線性分配,而是向性價比優者快速聚集。落入斬殺線的模型,幾乎立刻失去商業潛力,沒有第二名的生存空間。即便跟上了性價比領先者的腳步,也無法停下來。目前token成本由於模型優化與硬體升級處於快速下降通道,但降下來的成本在激烈的價格競爭中無法轉化為利潤。2026年7月30日,OpenAI將GPT-5.

6 Luna的價格驟降80%,次日DeepSeek便發布V4 Flash 0731。只要有一家將降本傳導為降價,其餘廠商不跟進就必須交出市場份額。這種競爭不是可以築牆守城的遊戲,而是每天都要爭奪的開闊地。OpenAI自己披露的數據就是最好的證明:算力從0.2吉瓦增至1.9吉瓦,收入從20億美元增至200億美元以上,投入與產出几乎線性對應,擴張並沒有帶來單位效率上的額外收益——這不是飛輪,而是跑步機。價格戰通常終止於成本。2026年5月23日,DeepSeek將V4 Pro API價格永久降至原定價的四分之一,創下全球大模型價格新低。

國新證券的研報指出,V4系列採用混合注意力架構與多token預測技術,單token推理浮點運算量僅為前代的27%,KV緩存大小降至前代的10%。Gartner預測,到2030年大模型推理成本將較2025年降低超過90%。路透社2026年7月援引匿名消息人士報道,DeepSeek正在研發自有的推理專用芯片,項目啟動約一年前;OpenAI、Anthropic等頭部廠商也早已公布自研芯片計劃。成本降低是一場耐力賽,價格戰的終點還在遠方。斬殺線還將繼續上移,推力來自技術進步與基礎設施投入。

V4 Flash 0731的架構與尺寸均未變動,僅重做了後訓練,Intelligence Index得分便從40升至50,反超自家V4 Pro (max) 的44分。自研芯片、自建算力、應用系統工程化等投入週期長、金額大,一旦轉化為能力與成本優勢,將進一步推高斬殺線。那些仍留在場內的玩家,面對的是不斷縮小的毒圈,隨時可能被淘汰。大模型行業的競爭已經慘烈到需要用生死來類比,沒有過渡地帶,只有生死局。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前