Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Agentic Coding Benchmarks, API Pricing, and Cost-Performance Tradeoffs Compared
重點摘要
Anthropic 推出 Claude Sonnet 5,定位為最具代理能力的中階模型,在多項基準測試中超越 Sonnet 4.6,並以更低的 API 定價提供競爭力。Sonnet 5 支援不同的運算努力等級,但在極高強度使用時,成本可能比旗艦 Opus 4.8 更高。新模型已成為免費與 Pro 方案的預設模型,並可在 Claude Code 等平台上使用。
Anthropic 近日正式推出 Claude Sonnet 5,號稱是該公司目前為止「最具代理能力」的中階模型。這款新模型不僅能自主規劃任務、操控瀏覽器與終端機,還能長時間獨立執行複雜工作鏈,在自主性與可靠度上均有顯著提升。即日起,免費方案與 Pro 方案的預設模型已切換為 Sonnet 5,Max、Team 及 Enterprise 用戶也可自行選用;此外,該模型也已同步上線 Claude Code 與 Claude 平台。Sonnet 系列在 Anthropic 產品線中定位於中間層級,低於旗艦款的 Opus 4.8,但高於主打平價的 Haiku 4.5。
此次推出的 Sonnet 5 是 2026 年 2 月發布之 Sonnet 4.6 的直接升級版本。Anthropic 強調這次更新並非只追求單一指標的突破,而是著力於代理能力的整體可靠性。具體而言,Sonnet 5 能在更長的任務鏈中穩定維持上下文,當工具呼叫失敗時也能更有效地自我修正,並在 Claude Code 或 Cowork 等環境中展現更一致的行為。在公開評測數據上,Sonnet 5 全面超越前代 Sonnet 4.6。根據 Anthropic 官方數據,在 SWE-bench Pro(代理編碼評測)中,Sonnet 5 達到 63.2%,遠高於 Sonnet 4.6 的 58.
1%;在 OSWorld-Verified(電腦使用能力評測)中獲得 81.2%,對比前代的 78.5%;在 Humanity’s Last Exam(HLE)工具使用評測中則拿下 57.4%,相較 Sonnet 4.6 的 46.8% 有大幅提升。值得注意的是,Sonnet 5 在知識工作評測 GDPval-AA v2 上取得 1,618 分,甚至微幅超越 Opus 4.8 的 1,615 分,顯示其在某些知識密集型任務中已具備接近旗艦的水準。不過,若與旗艦 Opus 4.8 相比,Sonnet 5 仍有一段距離。Opus 4.8 在 SWE-bench Pro 上達到 69.
2%,HLE 則為 57.9%,與 Sonnet 5 接近但略高。Anthropic 指出,對於精確度要求極高的任務,Opus 4.8 仍是首選,因為 Sonnet 5 在網路安全相關能力上被刻意壓低,以符合安全性設計。定價方面,Sonnet 5 採用了全新的計費結構。在 2026 年 8 月 31 日前的上市推廣期內,輸入價格為每百萬 token 2 美元,輸出為每百萬 token 10 美元;推廣期結束後將恢復為常規價格:輸入 3 美元、輸出 15 美元。相比之下,旗艦 Opus 4.8 的定價為輸入 5 美元、輸出 25 美元;前代 Sonnet 4.
6 則為輸入 3 美元、輸出 15 美元。需要注意的是,Sonnet 5 採用了與 Opus 4.7 相同的新版 tokenizer,同樣的文字在 Sonnet 5 中可能轉換為 1.0 到 1.35 倍的 token 數量,因此實際使用時成本需乘上這個倍數。為讓用戶更彈性控制成本與品質,Sonnet 5 引入了「努力層級」(effort levels)機制,分為 low、medium、high 與 xhigh(extra high)。當選擇更高努力層級時,模型會花費更多 token 進行推理,結果品質隨之提升,但成本也同步增加。這項設計讓開發者可以根據任務需求精細調配開支。
初步分析顯示,在低至中等努力層級下,Sonnet 5 的性價比優於 Opus 4.8;但在 xhigh 層級下,為達到近似品質所需花費可能比直接使用 Opus 4.8 更高,使用者需自行權衡。安全性方面,Anthropic 表示 Sonnet 5 比 Sonnet 4.6 更為安全,尤其刻意降低了網路攻擊相關能力,以減少被惡意利用的風險。這也呼應了該公司在負責任 AI 發展上的一貫立場。對於需要高準確度與強健安全性的企業應用,Opus 4.8 仍是最適合的選擇。整體而言,Claude Sonnet 5 的問世大幅縮小了中階模型與旗艦模型之間在代理任務上的差距。
它不僅在基準測試中全面勝過前代,更以更具競爭力的價格與彈性努力層級,為開發者提供了兼顧成本與效能的實用選項。隨著該模型成為免費與 Pro 方案的預設模型,一般用戶也能立即體驗到更強大的自主操作能力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。