Claude Opus 5來了,Fable 5性能、一半價格

2026年7月25日 09:46
Claude Opus 5來了,Fable 5性能、一半價格

重點摘要

Anthropic 發布新一代旗艦大模型 Claude Opus 5,性能與 Fable 5 極為接近,但價格僅為一半。該模型在編程、科研及視覺輸出等任務表現優異,並強化自我校驗與安全性。網友對此評論:「既然性能差不多,何必花兩倍價格用 Fable 5?」

站內 AI 整理稿

Anthropic 於今日凌晨正式推出新一代旗艦大語言模型 Claude Opus 5,這款模型主打「深思熟慮」與「主動響應」的雙重特性,在性能上極度逼近先前備受矚目的 Claude Fable 5,但價格僅為後者的一半。消息一出,立刻在社群平台上引發熱烈討論,有網友直指:「如果跟 Fable 5差不多,為什麼還要花兩倍的價格去用 Fable 5?」這也反映出市場對性價比的高度關注。在定價方面,Claude Opus 5 延續了前代 Opus 4.8 的收費標準,輸入每百萬 Token 5 美元、輸出每百萬 Token 25 美元。

開發者可以透過 API 中的 claude-opus-5 模型名稱進行調用。此外,Anthropic 還提供了快速模式(Fast mode),運行速度約為預設模式的 2.5 倍,但價格也相應提高至基礎價格的兩倍。這項設計讓用戶可以根據任務需求,在速度與成本之間取得平衡。Anthropic 特別強調,Opus 5 專為日常高頻使用場景而設計,工作效率比以往任何一代模型都更高。目前它已成為 Claude Max 服務的預設模型,同時也是 Claude Pro 方案中性能最強的選項。這意味著一般用戶與企業開發者都能以更低的成本享受到接近頂尖水準的 AI 能力。

在模型性能表現上,Claude Opus 5 在多項權威評測中名列前茅。在編程與知識工作領域,它在 Frontier-Bench 與 GDPval-AA 等測試中達到了業界最佳(SOTA)成績。然而,在網路安全任務方面,它仍落後於專門強化的 Mythos 5。Anthropic 這次的發佈可謂「端水大師」,既充分展現了新模型的實力,又給 Fable 5 與 Mythos 5 保留了足夠的尊嚴。具體來看,在高價值的軟體工程任務中,Opus 5 的表現尤為突出。在 Frontier-Bench v0.1 評估中,它不僅超越了所有其他模型,還在降低單項任務成本的同時,將性能提升至 Opus 4.

8 的兩倍以上。而在 CursorBench 3.2 測試中,若將努力模式調至最高(Max Effort),其性能距離 Fable 5 的峰值僅差 0.5%,但單任務成本卻只有後者的一半。在 High、Xhigh 與 Max 三種努力模式下,Opus 5 在相同成本下的性能表現均優於其他所有模型。除了軟體工程,Opus 5 在知識工作與複雜問題解決任務中也展現出顯著優勢。在 ARC-AGI 3 測試(評估模型解決全新未知問題的能力)中,它的得分是第二名模型的 3 倍。在 Zapier AutomationBench 上,相同單任務成本下,Opus 5 的通過率約為第二名模型的 1.5 倍。

即使在最低努力設定下,它所完成的任務數量也超過了其他任何模型。在 OSWorld 2.0 計算機操作基準測試中,Opus 5 在任意給定成本下的表現均優於其他模型,僅需略高於三分之一的成本就能超越 Fable 5 的最佳成績。對於科學研究領域,Opus 5 相比 Opus 4.8 帶來了全面躍升。在涵蓋結構生物學、有機化學與生物信息學等生命科學評估中,它的表現均優於前代。最顯著的突破包括:在有機化學任務中(如根據光譜數據推斷分子結構),內部基準測試得分比 Opus 4.8 高出 10.2 個百分點;在蛋白質相關任務中(如預測蛋白質序列變異對功能的影響),得分提升了 7.7 個百分點。

此外,Opus 5 還具備大幅增強的視覺輸出生成能力,能繪製空氣動力學風洞風流圖解、細胞結構互動圖示等複雜圖形。除了性能提升,Claude Opus 5 在自我校驗與迭代能力方面也有顯著進步。它能持續優化輸出直至任務成功,這正是當前業界高度關注的模型能力之一。在評測與早期測試中,湧現出多個典型案例:例如,在 Frontier-Bench 的一項任務中,模型收到一張機械零件圖紙,要求編寫程式碼在 FreeCAD 中重建 3D 模型,但系統刻意未提供直接查看圖紙的接口。

Opus 5 竟然自行編寫了一套電腦視覺處理管線,從原始像素中提取幾何特徵,成功完成機械零件重建,多次重複實驗均告成功,而其他競爭模型嘗試五次無一成功。再如,面對一款熱門開源套件管理器中的真實 Bug,Opus 5 找到了根本原因並修復了社區補丁遺漏的邊緣情況,而競爭模型僅修復了表面症狀。某交易公司的工程師使用 Opus 5 在單次會話中為一個新交易所構建了市場數據接入源,由於當時沒有可用於驗證的即時數據源,Opus 5 甚至自己構建了一套測試套件來檢查程式碼是否準確解析數據。業界知名人士也對 Opus 5 給予高度評價。

Cognition 執行長 Scott Wu 提到,該模型在自家 Devin 軟體中處理困難問題的除錯與根因分析時表現出色。Zapier 執行長 Wade Foster 指出,Claude Opus 5 在未增加 Token 消耗的前提下拿下 Zapier AutomationBench 榜首,它讀取了一份原始客戶健康度表格,端到端執行了整套客戶流失預防流程,舊模型無法完成,Opus 5 卻百分之百成功。Lovable 聯合創辦人 Fabian Hedin 認為,這是 Opus 家族自 4.5 以來最大的一次飛躍。

JetBrains IDE AI 負責人 Denis Shiryaev 則表示,Opus 5 最令人印象深刻的是其判別力與決策力,在寫下程式碼前會更深入思考,在規劃階段就能捕獲自己的邏輯缺陷,這是解題能力的一次重要跨越。在安全性方面,Anthropic 的自動化行為審計顯示,Opus 5 是其迄今為止對齊程度最高的模型。它比 Opus 4.8、Sonnet 5 或 Fable 5 更符合《Claude's Constitution》,欺騙行為發生率最低,且最不容易被誤導或誘導濫用。在避免可能產生不可逆副作用的輕率行為方面,它是目前 Anthropic 最安全的模型。與 Opus 4.

8 一樣,Anthropic 特意避免在網路攻防任務上訓練 Opus 5,但由於通用能力的提升,該模型在相關任務上仍有顯著增強,在尋找網路安全漏洞方面已逼近 Mythos 5。不過,在漏洞利用(將漏洞轉化為實質性威脅)方面,它仍大幅落後於 Mythos 5。網路安全分類器限制相對比 Fable 5 更加寬鬆,允許 Opus 5 在原始碼中查找漏洞,但會攔截基於二進制的漏洞掃描、滲透測試以及漏洞利用生成。遭攔截的請求會自動退回至 Opus 4.8。在生物領域,Opus 5 延續了與 Opus 4.8 類似的安全防護體系,被認為是目前可用於科學研究的最強通用模型。

此外,Anthropic 還更新了兩個處於測試階段的功能:對話中途更換工具時提示詞緩存不會失效,以及 API 自動降級處理,當請求被安全分類器標記時,系統會自動降級而非直接拒絕,從而減少用戶體驗中斷。整體而言,Claude Opus 5 在性能與性價比上取得了雙重突破,特別是在編程、複雜推理與知識工作領域提升顯著,自我校驗與迭代能力也有所加強。當前國內開源與閉源模型頻繁更新,給海外大模型廠商帶來顯著壓力,不少海外科技巨頭逐漸轉向採用中國模型,加碼「性價比」或許將成為海外大模型廠商後續的重要策略之一。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前