IT之家生成式AI

Anthropic Opus 5 發佈:性能逼近 Fable 5 但價格砍半,刷新 ARC-AGI-3 紀錄

2026年7月24日 06:42
Anthropic Opus 5 發佈:性能逼近 Fable 5 但價格砍半,刷新 ARC-AGI-3 紀錄

重點摘要

Anthropic 發布 Claude Opus 5 旗艦模型,效能接近更高規格的 Fable 5,但價格僅為一半,並在 ARC-AGI-3 測試中大幅領先其他模型。該模型在程式碼、知識工作及科學研究等領域表現出色,已成為 Claude Max 服務的預設模型。

站內 AI 整理稿

Anthropic 今日正式推出 Opus 系列最新旗艦模型——Claude Opus 5,這款模型在性能上較前代 Opus 4.8 顯著提升,但價格維持不變。官方表示,Opus 5 定位為適合日常使用的高效能模型,在部分能力上已接近更高規格的 Claude Fable 5,然而價格僅約後者的一半。目前 Opus 5 已成為 Claude Max 服務的預設模型,同時也是 Claude Pro 用戶所能使用的最高等級模型,在多項程式碼、知識工作與科學研究測試中皆達到當前最佳水準。

根據 Anthropic 公布的評測結果,Opus 5 在 Frontier-Bench、GDPval-AA 等程式碼與知識工作基準測試中取得領先。在 Frontier-Bench v0.1 測試中,Opus 5 不僅超越其他模型,相較 Opus 4.8 更將任務性能提升超過一倍,同時每項任務的成本更低。在 CursorBench 3.2 測試中,Opus 5 在最高努力模式下的表現僅比 Fable 5 峰值低 0.5%,但每項任務的成本約為 Fable 5 的一半。此外,無論在高、中高或最高努力設定下,Opus 5 在單位成本性能方面均優於其他模型。

在知識處理與問題解決能力方面,Opus 5 在 ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0 等評測中均獲得高分。其中,在 ARC-AGI 3 測試中,Opus 5 的得分約為第二名的三倍;而在衡量模型完成完整業務流程能力的 Zapier AutomationBench 中,其通過率約為成本相近模型的 1.5 倍。這些成績顯示 Opus 5 在複雜推理與自動化任務上的強大實力。Anthropic 指出,Opus 5 在科研任務中也有明顯進步,涵蓋結構生物學、有機化學、生物資訊學等領域。

舉例來說,在有機化學任務中,模型需根據光譜數據推斷分子結構,Opus 5 的表現比 Opus 4.8 高出 10.2 個百分點;在預測蛋白質序列變化對功能影響的任務中,則高出 7.7 個百分點。這些提升對學術研究與醫藥開發具有實際意義。在實際應用層面,Anthropic 強調 Opus 5 在驗證自身結果與持續迭代修正方面的能力更強。例如,在一項測試中,模型需要根據機器零件圖紙生成 FreeCAD 三維模型,但無法直接查看圖紙內容。Opus 5 自行編寫電腦視覺流程,從原始像素中提取幾何資訊,並成功完成模型重建。

另一項測試中,Opus 5 發現了一個開源軟體套件管理程式中的實際漏洞,並修復了社群補丁遺漏的問題。此外,一名交易公司的工程師使用 Opus 5 在一次會話中建構了一個新交易所的數據介面,在缺乏即時數據源驗證的情況下,模型還自行建立測試工具檢查程式碼解析結果。安全方面,Anthropic 表示 Opus 5 的安全限制比 Fable 5 更少,預計安全分類器的觸發次數會比 Fable 5 減少約 85%。不過,Opus 5 仍針對部分高風險場景設置限制。例如,在網路安全領域,模型可以協助分析原始碼中的漏洞,但會阻止基於二進位檔案的漏洞掃描、滲透測試以及漏洞利用程式碼生成等操作。

Anthropic 說明,Opus 5 並未經過專門的網路攻擊任務訓練,但隨著整體能力提升,其漏洞發現能力有所增強。在 OSS-Fuzz 測試中,Opus 5 與 Mythos 5 在漏洞發現方面表現接近,但在將漏洞轉化為實際攻擊工具方面仍明顯落後於 Mythos 5。在生物領域,Opus 5 延續 Opus 4.8 的安全機制,目前是 Anthropic 面向公眾開放的能力最強科研模型。不過,Anthropic 認為,Opus 5 在長時間、自主執行科研任務方面仍存在限制,而這類任務被認為可能帶來更高風險。

價格方面,Claude Opus 5 已透過 Anthropic 各平台上線,輸入價格為每百萬個詞元(token)5 美元(約合新台幣 165 元或人民幣 33.9 元),輸出價格為每百萬個詞元 25 美元(約合新台幣 825 元或人民幣 169.6 元),與 Opus 4.8 保持一致。開發者可透過 Claude API 呼叫 claude-opus-5。此外,Anthropic 還推出了 Opus 5 Fast 模式,運行速度約為預設模式的 2.5 倍,價格為基礎價格的兩倍。

同時,Anthropic 開放測試兩項新功能:一是在 Claude 平台中允許對話中途切換工具,二是在 API 中提供自動回退功能。自動回退功能讓用戶在安全分類器攔截請求時,可將任務自動轉交給其他可用模型處理,避免直接返回錯誤訊息。Anthropic 表示,Opus 5 與此前 Opus 系列模型一樣,面向一般用戶開放時不設置數據保留要求。整體而言,Opus 5 以接近旗艦 Fable 5 的性能、僅一半的價格,以及多項突破性評測成績,成為當前 AI 模型市場中極具競爭力的選擇。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前