Meet the New Claude Opus 5: Frontier-Class Agentic Coding and Computer Use at Unchanged Opus Pricing
重點摘要
Today, Anthropic released Claude Opus 5. It replaces Claude Opus 4.8 as the Opus-tier flagship. Pricing is unchanged at $5 per million input tokens and $25 per million output tokens.
Anthropic 今日正式發表全新旗艦模型 Claude Opus 5,直接取代兩個月前推出的 Claude Opus 4.8,成為 Opus 等級的新一代主力。官方強調,Opus 5 的智慧水準已接近尚未公開發布的 Claude Fable 5,但價格僅為後者的一半,定價維持不變,每百萬輸入 Token 收費 5 美元、每百萬輸出 Token 收費 25 美元。即日起,Opus 5 成為 Claude Max 方案的預設模型,同時也是 Claude Pro 方案中效能最強的選擇。對於 API 開發者而言,這次升級帶來了三個不可忽視的變革。首先,思考(Thinking)功能預設為開啟。
在 Opus 4.8 上,若不特別設定 thinking: {"type": "adaptive"},請求就不會進行思考;但 Opus 5 的所有請求都會自動啟用思考,開發者可透過 effort 參數控制思考深度。由於 max_tokens 同時限制了思考過程與回應文字,既有程式碼中的數值需要重新檢視。第二項是破壞性變更:若開發者嘗試將 thinking 設為 {"type": "disabled"} 並同時使用 effort 參數 xhigh 或 max,API 將回傳 400 錯誤。
這個限制是逐次請求強制執行,開發者必須將 effort 控制在 high 以下,否則就必須移除 thinking 欄位。第三,Anthropic 建議開發者刪除提示詞中的驗證指令,例如「請加入最終驗證步驟」這類要求,因為 Opus 5 本身已經會自動驗證自己的輸出,加入這類指令反而會導致過度驗證。官方已釋出 Opus 5 提示詞指南,說明如何調整提示模式。在規格面,Opus 5 的模型 ID 為 claude-opus-5,預設與最大上下文長度皆為 100 萬 Token,沒有提供較小的變體。最大輸出長度在同步 Messages API 上為 12.
8 萬 Token;若使用 Message Batches API 並加上 output-300k-2026-03-24 beta 標頭,則可達 30 萬 Token。此外,可快取提示的最小門檻從 1024 Token 降至 512 Token,有助於開發者節省成本。編碼與代理能力是本次升級最明顯的亮點。在 FrontierBench v0.1(Terminal-Bench 2.1 的後繼評測,共 74 項任務)中,Opus 5 在 max effort 設定下獲得 43.3% 分數,遠高於 Opus 4.8 的 18.7%,也超越 Fable 5 的 33.7% 與 GPT-5.
6 Sol 的 37.5%。若將 effort 拉高至 xhigh,平均獎勵達到 44.4%,為最佳成績。值得注意的是,在該測試中,Opus 5 的安全分類器標記並拒絕了 5% 的 API 呼叫(涵蓋 4% 的試驗),而 Fable 5 的分類器則標記了 42% 的呼叫(涵蓋 26% 的試驗),顯示 Opus 5 在安全過濾上的干預頻率大幅降低。在 SWE-bench Verified 上,Opus 5 拿下 96.0%,SWE-bench Pro 則為 79.2%,僅略低於 Fable 5 的 80.0%。但在 SWE-bench Multimodal 上,進步幅度顯著,從 38.
4% 躍升至 59.4%。代理任務的表現更為突出:Opus 5 在 OSWorld 2.0 達到 70.57%,Opus 4.8 僅 55.7%;Zapier AutomationBench 則從 17.0% 提升至 26.0%,Fable 5 在同項目為 17.4%。若將 effort 設為中等,每項任務成本僅 0.89 美元,仍可獲得 24% 分數。在 Artificial Analysis GDPval-AA v2 排行榜上,Opus 5 以 ELO 1861 與 1827 佔據前兩名,其中 xhigh 設定不僅擊敗所有其他模型,且輸出 Token 數比 max 設定少了 25%。
推理能力同樣有驚人成績。Anthropic 讓 Opus 5 在不使用工具或代理框架的情況下,直接解答 IMO 2026 全部六道題目,由三個模型組成的評審團判定所有 24 個解答正確。人類專家獨立評分每題一個預先指定的解答,全部獲得 7/7 滿分,總分 42/42 達到金牌水準,遠高於 29/42 的合格線。在 ARC-AGI-3 評測中,ARC Prize 基金會驗證 Opus 5 在 high effort 下達到 30.16%,約為先前最佳排行榜成績的四倍;GPT-5.6 Sol 僅 7.78%,Opus 4.8 更是只有 1.52%。發布時 max effort 的結果尚未出爐。
而在 Humanity's Last Exam 上,Opus 5 不使用工具獲得 56.3%,使用工具則提升至 64.7%。多模態任務的結果帶來一個實務教訓:代理工具能更有效地擴展測試時計算資源,效果勝過單純的適應性思考。在 Chartography 評測中,Opus 5 不使用工具僅得 29.6%,但搭配容器與裁圖工具後躍升至 83.0%。在 BenchCAD Vision2Code 上,體素 IoU 從 0.366 提升至 0.821,甚至大幅超越 Claude Mythos 5 的 0.678。
網路安全能力方面,Anthropic 並未針對性訓練 Opus 5 的網路攻擊技能,但隨著整體能力提升,安全相關表現也跟著增強。在 ExploitBench 的 AutoNudge 項目中,Opus 5 獲得 10.14 個能力標記,並產生 99 個完整任意程式碼執行漏洞(Mythos 5 為 132 個)。在 OSS-Fuzz 上,Opus 5 在 79.4% 的目標中獲得非零分數,Mythos 5 約為 80%。但 Opus 5 僅完成 4 個完整漏洞利用,Mythos 5 則有 13 個。
這項差距正是安全設計的關鍵:Opus 5 在發現漏洞的能力上幾乎與 Mythos 5 相當,但在實際利用漏洞的能力上明顯落後。因此,Anthropic 放寬了原始碼漏洞發現的限制,但二進位掃描、滲透測試與漏洞利用生成仍維持封鎖。分類器的干預頻率預計比 Fable 5 減少約 85%。防禦者可申請加入網路驗證計畫。英國 AISI 對早期檢查點進行了三項網路範圍測試,每次嘗試耗用 1 億 Token。Opus 5 在「The Last Ones」範圍中,10 次嘗試有 8 次成功端到端破解;在更困難的「Doing Life」範圍中,雖未完全破解,但抵達步驟 22(共 23 步),超越所有受測模型。
根據 Anthropic 的負責任擴展政策(RSP),Opus 5 被歸類為具備 CB-1 能力但未達 CB-2,並採用與 Opus 4.8 相同的 ASL-3 保護措施,未跨越 AI 研發門檻。提示注入攻擊的防禦是本次安全報告中最突出的數字。在 Gray Swan 間接提示注入基準測試中,攻擊者在 15 次嘗試內的成功率從 Opus 4.8 的 5.5% 降至 2.0%,Mythos 5 為 2.6%,GPT-5.6 Sol 則高達 20.0%。在透過 Claude Cowork 運行的瀏覽器環境中,攻擊成功率從 Opus 4.8 的 31.5% 降至 3.
70%,且此為未施加任何安全機制的結果;若啟用自動模式,則在全部 129 個環境中達到 0% 成功率。總體而言,Claude Opus 5 在價格不變的前提下,於編碼、代理、推理與安全等面向均展現顯著進步。Anthropic 也主動揭露了部分負面資訊,例如事實性幻覺發生率略高於 Opus 4.8。開發者與用戶可從 API 或 Claude 產品中直接體驗這款新模型。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。