鈦媒體生成式AI

毒圈縮圈:AI大模型的“斬殺線”還在上移

2026年8月5日 10:06
毒圈縮圈:AI大模型的“斬殺線”還在上移

重點摘要

AI大模型行業進入殘酷內卷,Agent成為主流應用後,模型競爭轉向任務維度的綜合性價比對決,斬殺線持續上移、毒圈不斷收縮。模型性價比差異被Agent放大,落入斬殺範圍的模型迅速失去市場地位,廠商只能持續降本迭代,無法形成穩固壁壘。

站內 AI 整理稿

AI大模型領域的競爭已進入前所未有的殘酷階段,業界開始用「斬殺線」與「毒圈」這類遊戲術語來形容當前的市場淘汰賽。2026年7月31日,DeepSeek發布了V4 Flash 0731版本,這款模型在Artificial Analysis的Intelligence Index評測中拿下50分,較前一代V4 Flash整整高出10分。若將各家模型放在同一張散點圖上,縱軸代表能力得分,橫軸則是每項任務的平均成本,V4 Flash 0731恰好落在左上角,從它出發向右下方畫出一塊區域——區域內所有模型成本更高、能力卻更弱。這塊區域被中文AI圈稱為「斬殺線」,落入其中的模型几乎等於被一擊必殺;英文圈則稱之為Kill Zone。而對於那些勉強站在線上的模型來說,威脅還在加速逼近,因為「毒圈」正在不斷縮小。 這兩個詞之所以同時在兩岸AI社群中流行,正反映出大模型行業競爭維度的根本轉變:評判標準不再是單輪對話的準確率,而是模型能否有效完成一連串的任務。隨著Agent(智能體)成為主流應用方式,模型的使用場景從一次性的問答變成了需要多步驟協作、調用外部工具、甚至自動重試的複雜任務。單次回答的準確率已無法代表任務最終的成敗,而按token計價的傳統測試也無法反映真實支出。2026年5月,美國國家標準與技術研究院下屬的CAISI公布了一份DeepSeek V4 Pro與GPT-5.4 mini的對比評估,結果顯示同一對模型在不同任務上的成本差異可以從便宜53%到貴41%——換一組任務,成本高低便完全顛倒。 正因如此,Artificial Analysis推出的Intelligence Index v4.1直接以「任務」為核心設計了兩個座標軸。縱軸的能力指數由九項評測加權構成,其中智能體任務佔比最高達34%,其次為編程與科學推理各24%,通用能力僅佔18%。橫軸的每任務成本則是跑完整套指數的總花費除以任務總數,並按輸入、緩存命中、緩存寫入、推理、回答五類token分別計價。在這一標準下,Claude Opus 4.8 (max) 能力得分56分,但每任務成本高達1.78美元;DeepSeek V4 Pro (max) 得分44分,成本僅0.04美元;而新版V4 Flash 0731得分50分,每任務成本約0.09美元,即便與能力最接近的GPT-5.6 Luna (max)(51分)相比,後者在7月30日大幅降價80%之後,V4 Flash 0731的成本仍低了約60%。散點圖的左上角近乎空白,凸顯了V4 Flash 0731現階段的性價比優勢。 Agent不僅改變了評測方式,也極大放大了模型之間的成本與能力差距。一篇由Bai Longju等人於2026年4月發表的論文《How Do AI Agents Spend Your Money?》分析了八個前沿模型在SWE-bench Verified上的執行軌跡,發現Agent編碼任務的token消耗量是普通代碼問答與推理的一千倍。以官方定價計算,Claude Opus 4.8輸出每百萬token要25美元,而DeepSeek V4 Flash僅0.28美元。一次簡單問答的支出差額僅以美分計,但在一項Intelligence Index任務上,Claude Opus 4.8 (max) 每任務成本達1.78美元,V4 Flash 0731約0.09美元,差額接近1.7美元。更關鍵的是,Agent任務中消耗的token還在快速增長:Artificial Analysis指出,Claude Sonnet 5的每任務成本已較前代翻倍,增量全部來自用量增加而非單價上漲。同時,能力差距也因任務步驟的串聯而被放大——單輪回答準確率95%與90%只差五個百分點,但二十步之後成功率分別為36%與12%,前者接近後者的三倍;再加上重試機制帶來的額外開銷,能力不足直接轉化為更高的支出。 Agent的應用還讓模型的能力評測變得更加複雜。7月,Reddit的r/LocalLLaMA上有一篇獨立評測,將DeepSeek V4 Flash分別接入Pi、OpenCode、Claude Code、Nanocoder四個不同的Agent框架,執行同一批真實bug修復任務。結果四個框架的能力得分落在同一重疊區間,但消耗的token與時間卻相差四倍。這說明模型只是系統中的一個部件,真正的能力與成本必須放在具體的Agent框架與任務中才能準確衡量。Artificial Analysis為此自建並開源了統一的測試框架Stirrup,所有模型的Intelligence Index跑分都在這個框架內完成,以確保比較的公平性。 大模型市場的切換成本極低,這使得「斬殺線」的殺傷力加倍。API調用標準化、操作協議開放,開發者可以快速在多個模型間切換,用戶甚至不知道底層模型是誰。基礎模型層的進步已明顯放緩,同質化競爭加劇,同一能力檔位的模型只要工程配套完備,切換不會帶來顯著的質量下降。因此,市場份額並非隨性價比差距線性分配,而是向性價比優者快速聚集。落入斬殺線的模型,幾乎立刻失去商業潛力,沒有第二名的生存空間。 即便跟上了性價比領先者的腳步,也無法停下來。目前token成本由於模型優化與硬體升級處於快速下降通道,但降下來的成本在激烈的價格競爭中無法轉化為利潤。2026年7月30日,OpenAI將GPT-5.6 Luna的價格驟降80%,次日DeepSeek便發布V4 Flash 0731。只要有一家將降本傳導為降價,其餘廠商不跟進就必須交出市場份額。這種競爭不是可以築牆守城的遊戲,而是每天都要爭奪的開闊地。OpenAI自己披露的數據就是最好的證明:算力從0.2吉瓦增至1.9吉瓦,收入從20億美元增至200億美元以上,投入與產出几乎線性對應,擴張並沒有帶來單位效率上的額外收益——這不是飛輪,而是跑步機。 價格戰通常終止於成本。2026年5月23日,DeepSeek將V4 Pro API價格永久降至原定價的四分之一,創下全球大模型價格新低。國新證券的研報指出,V4系列採用混合注意力架構與多token預測技術,單token推理浮點運算量僅為前代的27%,KV緩存大小降至前代的10%。Gartner預測,到2030年大模型推理成本將較2025年降低超過90%。路透社2026年7月援引匿名消息人士報道,DeepSeek正在研發自有的推理專用芯片,項目啟動約一年前;OpenAI、Anthropic等頭部廠商也早已公布自研芯片計劃。成本降低是一場耐力賽,價格戰的終點還在遠方。 斬殺線還將繼續上移,推力來自技術進步與基礎設施投入。V4 Flash 0731的架構與尺寸均未變動,僅重做了後訓練,Intelligence Index得分便從40升至50,反超自家V4 Pro (max) 的44分。自研芯片、自建算力、應用系統工程化等投入週期長、金額大,一旦轉化為能力與成本優勢,將進一步推高斬殺線。那些仍留在場內的玩家,面對的是不斷縮小的毒圈,隨時可能被淘汰。大模型行業的競爭已經慘烈到需要用生死來類比,沒有過渡地帶,只有生死局。

Related

相關文章

我們,已在奇點之中

我們,已在奇點之中 2026年8月5日,新智元 如果說過去十年裡,「奇點」這個詞還只是科幻迷和未來學家餐桌上的談資,那麼現在,它已經被寫進了硅谷最具權勢的四個人的公開講話裡。OpenAI、谷歌DeepMind、xAI、英偉達,這四家常年明爭暗鬥的巨頭,掌門人竟然在同一件事上罕見地達成共識:人類文明的技術進程,已經跨過了那道門檻。 這一切,要先從一次令人後脊發涼的安全測試講起。 前些天,OpenAI將自家最強模型GPT-5.

剛剛

張一鳴為什麼把50%的時間給了Seed?

張一鳴為什麼把50%的時間給了Seed? 在AI賽道,那種字節一齣牌就讓同行失眠的產品,尚未出現。張一鳴的時間和精力,都放在了哪?今日資本創始人徐新最近在一次播客裡提到了這件事。她現場勸說星海圖CEO高繼揚少管日常管理,多盯技術方向。她舉的例子,是張一鳴。她說,抖音是多麼大的生意,張一鳴50%的時間放在Seed上面。一個叫Seed的研究團隊。大部分普通用戶沒聽過這個名字。 這幾句話讓我產生的第一反應,是疑惑。今年上半年,騰訊跑出WorkBuddy,阿里連續調整組織架構。字節呢?

剛剛

只因太聽人類話,GPT變“終結者”失控入侵

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作只因太聽人類話,GPT變“終結者”失控入侵酷玩實驗室·2026年08月05日 10:23AI需要杞人憂天嗎? 01:AI要翻天? 今年最像科幻片中人工智能失控的場景出現了。 OpenAI 還未正式發佈的最新模型,竟然主動對全球最大的AI開源平臺Hugging Face展開了入侵與攻擊。 根據 Hugging Face 的官方通告,即使當時已經重建了完整的攻擊時間線,但依舊無法鎖定背後的攻擊方是誰。 這個神秘攻擊者在短短一個週末的時間內,就執行了超17000次自動化操作,竊取了多項內部數據集和服務憑證。 可直到發佈攻擊通告後的第五天,OpenAI 才跑出來說:“不好意思,是我沒管住自家孩子......” 依舊喪事喜辦 根據 OpenAI的說法,這起史無前例的人工智能入侵事件,源於上週在內網對自家兩款頂尖大模型進行能力測試。 測試採用的基準叫ExploitGym,作為業內廣泛使用的網絡安全能力測試,可以理解為給大模型準備的一場封閉黑客實操考試:大模型需隔離在沙盒環境裡,不能接入外界互聯網,只能依靠簡單的軟件安裝包工具,來把已知的安全漏洞轉化為可執行的攻擊。 結果,OpenAI 的大模型琢磨了半天,發現了內網可訪問的第三

剛剛

資本重倉端側物理AI:前海母基金數億元押注,Om AI聯匯加速端側AI商業化落地

Om AI聯匯完成新一輪數億元融資,由前海母基金領投,資金將用於VLX模型迭代及物理AI商業化落地。公司同時開源端側模型VLX-Seek 1.5,在參數規模與英偉達同級模型相比表現更優。目前其端側AI技術已與聯想、蘋果等合作,並透過可穿戴裝置服務近十萬視障用戶,商業化進程持續推進。

剛剛