MarkTechPost AI生成式AI

Meet the New Claude Opus 5: Frontier-Class Agentic Coding and Computer Use at Unchanged Opus Pricing

2026年7月24日 21:50

重點摘要

Today, Anthropic released Claude Opus 5. It replaces Claude Opus 4.8 as the Opus-tier flagship. Pricing is unchanged at $5 per million input tokens and $25 per million output tokens.

站內 AI 整理稿

Anthropic 今日正式發表全新旗艦模型 Claude Opus 5,直接取代兩個月前推出的 Claude Opus 4.8,成為 Opus 等級的新一代主力。官方強調,Opus 5 的智慧水準已接近尚未公開發布的 Claude Fable 5,但價格僅為後者的一半,定價維持不變,每百萬輸入 Token 收費 5 美元、每百萬輸出 Token 收費 25 美元。即日起,Opus 5 成為 Claude Max 方案的預設模型,同時也是 Claude Pro 方案中效能最強的選擇。 對於 API 開發者而言,這次升級帶來了三個不可忽視的變革。首先,思考(Thinking)功能預設為開啟。在 Opus 4.8 上,若不特別設定 thinking: {"type": "adaptive"},請求就不會進行思考;但 Opus 5 的所有請求都會自動啟用思考,開發者可透過 effort 參數控制思考深度。由於 max_tokens 同時限制了思考過程與回應文字,既有程式碼中的數值需要重新檢視。 第二項是破壞性變更:若開發者嘗試將 thinking 設為 {"type": "disabled"} 並同時使用 effort 參數 xhigh 或 max,API 將回傳 400 錯誤。這個限制是逐次請求強制執行,開發者必須將 effort 控制在 high 以下,否則就必須移除 thinking 欄位。第三,Anthropic 建議開發者刪除提示詞中的驗證指令,例如「請加入最終驗證步驟」這類要求,因為 Opus 5 本身已經會自動驗證自己的輸出,加入這類指令反而會導致過度驗證。官方已釋出 Opus 5 提示詞指南,說明如何調整提示模式。 在規格面,Opus 5 的模型 ID 為 claude-opus-5,預設與最大上下文長度皆為 100 萬 Token,沒有提供較小的變體。最大輸出長度在同步 Messages API 上為 12.8 萬 Token;若使用 Message Batches API 並加上 output-300k-2026-03-24 beta 標頭,則可達 30 萬 Token。此外,可快取提示的最小門檻從 1024 Token 降至 512 Token,有助於開發者節省成本。 編碼與代理能力是本次升級最明顯的亮點。在 FrontierBench v0.1(Terminal-Bench 2.1 的後繼評測,共 74 項任務)中,Opus 5 在 max effort 設定下獲得 43.3% 分數,遠高於 Opus 4.8 的 18.7%,也超越 Fable 5 的 33.7% 與 GPT-5.6 Sol 的 37.5%。若將 effort 拉高至 xhigh,平均獎勵達到 44.4%,為最佳成績。值得注意的是,在該測試中,Opus 5 的安全分類器標記並拒絕了 5% 的 API 呼叫(涵蓋 4% 的試驗),而 Fable 5 的分類器則標記了 42% 的呼叫(涵蓋 26% 的試驗),顯示 Opus 5 在安全過濾上的干預頻率大幅降低。 在 SWE-bench Verified 上,Opus 5 拿下 96.0%,SWE-bench Pro 則為 79.2%,僅略低於 Fable 5 的 80.0%。但在 SWE-bench Multimodal 上,進步幅度顯著,從 38.4% 躍升至 59.4%。代理任務的表現更為突出:Opus 5 在 OSWorld 2.0 達到 70.57%,Opus 4.8 僅 55.7%;Zapier AutomationBench 則從 17.0% 提升至 26.0%,Fable 5 在同項目為 17.4%。若將 effort 設為中等,每項任務成本僅 0.89 美元,仍可獲得 24% 分數。在 Artificial Analysis GDPval-AA v2 排行榜上,Opus 5 以 ELO 1861 與 1827 佔據前兩名,其中 xhigh 設定不僅擊敗所有其他模型,且輸出 Token 數比 max 設定少了 25%。 推理能力同樣有驚人成績。Anthropic 讓 Opus 5 在不使用工具或代理框架的情況下,直接解答 IMO 2026 全部六道題目,由三個模型組成的評審團判定所有 24 個解答正確。人類專家獨立評分每題一個預先指定的解答,全部獲得 7/7 滿分,總分 42/42 達到金牌水準,遠高於 29/42 的合格線。在 ARC-AGI-3 評測中,ARC Prize 基金會驗證 Opus 5 在 high effort 下達到 30.16%,約為先前最佳排行榜成績的四倍;GPT-5.6 Sol 僅 7.78%,Opus 4.8 更是只有 1.52%。發布時 max effort 的結果尚未出爐。而在 Humanity's Last Exam 上,Opus 5 不使用工具獲得 56.3%,使用工具則提升至 64.7%。 多模態任務的結果帶來一個實務教訓:代理工具能更有效地擴展測試時計算資源,效果勝過單純的適應性思考。在 Chartography 評測中,Opus 5 不使用工具僅得 29.6%,但搭配容器與裁圖工具後躍升至 83.0%。在 BenchCAD Vision2Code 上,體素 IoU 從 0.366 提升至 0.821,甚至大幅超越 Claude Mythos 5 的 0.678。 網路安全能力方面,Anthropic 並未針對性訓練 Opus 5 的網路攻擊技能,但隨著整體能力提升,安全相關表現也跟著增強。在 ExploitBench 的 AutoNudge 項目中,Opus 5 獲得 10.14 個能力標記,並產生 99 個完整任意程式碼執行漏洞(Mythos 5 為 132 個)。在 OSS-Fuzz 上,Opus 5 在 79.4% 的目標中獲得非零分數,Mythos 5 約為 80%。但 Opus 5 僅完成 4 個完整漏洞利用,Mythos 5 則有 13 個。這項差距正是安全設計的關鍵:Opus 5 在發現漏洞的能力上幾乎與 Mythos 5 相當,但在實際利用漏洞的能力上明顯落後。因此,Anthropic 放寬了原始碼漏洞發現的限制,但二進位掃描、滲透測試與漏洞利用生成仍維持封鎖。分類器的干預頻率預計比 Fable 5 減少約 85%。防禦者可申請加入網路驗證計畫。 英國 AISI 對早期檢查點進行了三項網路範圍測試,每次嘗試耗用 1 億 Token。Opus 5 在「The Last Ones」範圍中,10 次嘗試有 8 次成功端到端破解;在更困難的「Doing Life」範圍中,雖未完全破解,但抵達步驟 22(共 23 步),超越所有受測模型。根據 Anthropic 的負責任擴展政策(RSP),Opus 5 被歸類為具備 CB-1 能力但未達 CB-2,並採用與 Opus 4.8 相同的 ASL-3 保護措施,未跨越 AI 研發門檻。 提示注入攻擊的防禦是本次安全報告中最突出的數字。在 Gray Swan 間接提示注入基準測試中,攻擊者在 15 次嘗試內的成功率從 Opus 4.8 的 5.5% 降至 2.0%,Mythos 5 為 2.6%,GPT-5.6 Sol 則高達 20.0%。在透過 Claude Cowork 運行的瀏覽器環境中,攻擊成功率從 Opus 4.8 的 31.5% 降至 3.70%,且此為未施加任何安全機制的結果;若啟用自動模式,則在全部 129 個環境中達到 0% 成功率。 總體而言,Claude Opus 5 在價格不變的前提下,於編碼、代理、推理與安全等面向均展現顯著進步。Anthropic 也主動揭露了部分負面資訊,例如事實性幻覺發生率略高於 Opus 4.8。開發者與用戶可從 API 或 Claude 產品中直接體驗這款新模型。

Related

相關文章

量子位生成式AI

具身智能的「ChatGPT時刻」還沒到,科沃斯先把機器人拆開了

科沃斯在蘇州成立「八界開源智創空間」,將旗下具身智能機器人「八界」的軟硬體全面開源,免費提供給開發者、學生與研究人員使用。這款機器人採用輪式底盤與機械臂設計,不以人形為訴求,而是專注於家庭空間的實際應用。科沃斯表示,具身智能的「ChatGPT時刻」尚未到來,希望透過開源共創,補足機器人對環境認知與場景適應的技術缺口。

1 小時前
鈦媒體生成式AI

AI下一步將邁向何方?一場正在發生的範式革命

AI下一步將邁向何方?一場正在發生的範式革命JHMS貝殼2026.07.25 19:33 · 來自上海全文2774字00:00 / 07:30當這場“革命”真正到來時,人類對“智能”的理解將被徹底刷新,它不再是快速執行命令的工具,而是能夠主動思考和探索未知的“大腦”。到那時,我們再回頭看今天的大模型競賽,或許就像今天回頭看當年的功能機之爭,聲勢浩大,卻遠不是終局。文 | JHMS貝殼2024年底,《美國天文學雜誌》發表了一篇論文。論文只有一位作者,不是資深教授,不是博士後,而是一名18歲的高中生。他利用一顆已退役的小行星觀測衛星留下的舊數據重新分析,最終發現了近150萬個此前從未被編目的天體。而這顆衛星當初的設計用途,甚至不是為了尋找這些天體。這是阿里雲創始人王堅在2026WAIC(世界人工智能大會)上講述的一個真實案例。開篇這個案例,跟大多數人理解的“AI”似乎沒什麼關係——不涉及大模型、不涉及算力、不涉及任何我們熟悉的AI標籤。但正是這個看似不相干的故事,指向了當前人工智能發展中最容易被忽視、也最可能引發下一輪變革的重要方向。一、驚人速度:但AI遠未觸及“智能”本質今天,討論人工智能幾乎不會讓任何人感到陌生。它可以回答問題、創作內容、編寫代碼、輔助辦公。CNNIC數據顯示,截至2025年12月,中國生成式人工智能用戶已達6.02億人,普及率42.8%。從2023年ChatGPT引爆公眾認知到42.8%的普及率,這條路只走了2年左右。在國內,從DeepSeek-R1模型問世算起,這個時間跨度更短,僅僅1年。回顧科技進程史,儘管革命性技術從問世到普遍應用的週期持續縮短,但同樣42%普及率,中國從1997年正式接入互聯網到2012年達到這個水平,用了整整15年。AI的普及速度不可謂不驚人。然而,一個值得正視的問題是:我們如今日常使用的AI,真的“智能”嗎?答案恐怕沒那麼樂觀。

1 小時前