Anthropic發佈Opus 5,性能直逼Fable 5,價格卻只有一半?!

重點摘要
Anthropic發佈Opus 5,性能直逼Fable 5,價格卻只有一半?!字母AI2026.07.25 10:13 · 來自北京全文3698字00:00 / 10:25求奧特曼此時的心理陰影面積。文 | 字母AIAnthropic真是“瘋”了。就在剛剛,新模型Opus 5發佈,性能直逼旗艦模型Fable 5,價格卻降了一半。5月28日,Claude Opus 4.8發佈。
# Anthropic 發布 Opus 5,性能直逼旗艦 Fable 5、價格砍半,奧特曼的「心理陰影面積」有多大?Anthropic 真可說是「殺紅了眼」。就在台灣時間 7 月 24 日晚間,Anthropic 無預警推出最新旗艦級模型 Claude Opus 5,號稱在多項關鍵評測中性能直逼自家頂規模型 Fable 5,但每項任務成本卻僅有 Fable 5 的一半。更令業界震動的是,距離 Fable 5 與 Mythos 5 發布不過 45 天,距離 Sonnet 5 上線也僅 24 天,Anthropic 等於在短短 57 天內將 Claude 家族主要產品線全部翻新了一遍。
這波更新不僅節奏驚人,更直接瞄準 OpenAI 的腹地。7 月 9 日,OpenAI 才剛發布 GPT-5.6,並在官方評測中將 Fable 5 列為主要對標模型;15 天後,Anthropic 就以 Opus 5 回敬,不僅將 GPT-5.6 Sol 放進核心對比,更在陌生問題求解、電腦操作、商業流程等項目中高調展示優勢。兩家 AI 巨頭你追我趕、互不相讓的態勢,已將模型競賽推向白熱化。## 57 天瘋狂迭代,Anthropic 誓言「打敗自己」
Anthropic 這輪產品更新節奏之快,即便在以「按月迭代」聞名的 AI 行業也屬罕見。5 月 28 日,Claude Opus 4.8 才剛發布;6 月 10 日,能力更強的 Fable 5 與 Mythos 5 接連登場;6 月 30 日,Sonnet 5 上線;到了 7 月 24 日,Opus 5 便已問世。尤其 Fable 5 與 Opus 5 之間僅相隔 45 天,令外界嘩然。Fable 5 在發布時被定位為 Anthropic 面向一般用戶開放的「能力標杆」,按照業界慣例,這類模型至少應在聚光燈下停留數月。
然而 Opus 5 的迅速追趕,幾乎等於 Anthropic 公開宣示:「打敗我的只能是我自己」。這種不惜與自家產品自相競爭的策略,不僅展現了 Anthropic 在技術迭代上的自信,也凸顯其搶佔市場的強烈企圖。## 性能大幅躍升,多項評測超越前代與對手
根據 Anthropic 公布的數據,Opus 5 的 API 定價與上一代 Opus 4.8 完全相同——每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元——但性能表現卻有飛躍式進步。尤其值得注意的是,Anthropic 引入「投入檔位」(effort level)概念,讓用戶可根據任務難度自行調整模型運算資源,簡單任務選低檔位節省成本,複雜任務則拉高檔位換取更佳結果。在軟體工程任務方面,Opus 5 的表現尤為亮眼。在 Frontier-Bench v0.1 評測中,Opus 5 全面超越所有其他模型;與 Opus 4.8 相比,每項任務成本更低,但成績提高一倍以上。
在 CursorBench 3.2 評測中,當投入檔位設為最高時,Opus 5 與 Fable 5 最高得分之間的差距不到 0.5%,然而每項任務成本僅有 Fable 5 的一半。換句話說,用戶若以相同預算運行 Opus 5,可完成的任務數量與品質都遠勝以往。## 陌生問題求解能力突出,得分為第二名三倍
Opus 5 最令人驚豔的優勢之一,是面對從未見過的問題時的應變能力。在 ARC-AGI 3 這類「陌生題」測試中,模型無法仰賴既有套路,必須自行摸索規則、判斷目標並調整策略。Opus 5 的得分達到第二名的三倍,顯示其在面對全新問題時,更具備透過試錯找到解法的潛力。這項特質也反映在真實工作流程的評測中。AutomationBench 要求模型調用商業軟體從頭到尾完成任務,Opus 5 的通過率約為第二名的 1.5 倍;即使使用最低投入檔位,也能超越其他模型的最高成績。這意味著 Opus 5 不需要付出最高的推理成本,就能完成更多實際工作。在電腦操作測試 OSWorld 2.
0 中,Opus 5 同樣在各個成本區間領先,僅花費略高於 Fable 5 三分之一的成本,成績便超越了 Fable 5 的最高水準。無論是打開應用程式、查找資訊、跨軟體操作或持續推進任務,Opus 5 的效率都明顯更高。## 工具使用成關鍵優勢,成本優勢進一步擴大
Opus 5 的另一大亮點,是其在允許使用工具後表現顯著提升。在 HLE(跨學科難題)評測中,不調用工具時 Opus 5 以 56.3% 略低於 Fable 5 的 56.5%;但允許使用工具後,Opus 5 一舉升至 64.7%,反超 Fable 5 的 63.9%,且成本更低。這說明 Opus 5 在單靠模型內部知識時未必總是第一,但一旦可以搜尋、調用工具、反覆核對,優勢便會迅速擴大。在模擬真實知識工作的 GDPval-AA v2 中,Opus 5 最高得分 1861,高於 Fable 5 的 1747 與 GPT-5.6 Sol 的 1736。
大約花費 700 美元,就能達到其他模型最高投入檔位附近的成績。在 DeepSearchQA 上領先幅度雖然較小,但同樣以更低成本取得了略高的通過率。## 生物醫學與科學研究潛力巨大
在生命科學領域,Opus 5 在 Anthropic 全部相關評測中都超越了 Opus 4.8,其中光譜推斷分子結構和預測蛋白質變異影響兩項任務,分別提升 10.2 和 7.7 個百分點。這些提升意味著 Opus 5 在輔助分子結構分析、蛋白質功能預測等科研環節上,具備更大的應用潛力。 Anthropic 還展示了 Opus 5 的視覺生成能力。透過兩個可互動的演示——三維風洞與三維動物細胞模型——Opus 5 已能將程式碼、三維建模、互動介面與知識講解整合進同一個成品。用戶只需給出文字需求,模型便可直接產出接近教學軟體或產品原型的互動演示。 ## 安全與對齊:能力越強,防線越需謹慎
能力提升的同時,安全問題也成為 Anthropic 本次發布的重點論述。Opus 5 在測試中展現出極強的主動推進能力:一次測試要求模型根據機械零件圖紙用程式碼重建 FreeCAD 三維模型,但系統未提供直接查看圖紙的工具,Opus 5 便自行撰寫了一套電腦視覺程式,從原始像素中擷取尺寸與幾何結構完成建模;同一條件下,其他模型連續嘗試 5 次都失敗。另一次任務來自一個開源套件管理器,Opus 5 不僅查出了程式錯誤的根本原因,還補上了社群修復方案遺漏的邊緣情況;而參與對比的另一款模型只消除了表面症狀便宣告解決。
一家交易公司的工程師讓 Opus 5 為新交易所搭建市場數據系統,先前模型即使拿到詳細方案也無法完成,Opus 5 則在找不到即時數據時自行製作測試工具檢查程式碼。這些案例說明了 Opus 5 的進步,但也解釋了 Anthropic 為何投入大量篇幅討論安全。模型開始自行補工具、檢查結果、修正錯誤後,人類必須確認它不會為了完成目標隱瞞問題、繞過限制或做出高風險決定。Anthropic 宣稱,Opus 5 是目前「對齊」表現最好的 Claude 模型,上線前自動化審計顯示,與 Opus 4.
8、Sonnet 5 和 Fable 5 相比,Opus 5 更能遵守 Claude 憲法,欺騙行為更少,也更難被誘導執行有害請求。## 網路安全與生物領域的風險控管
網路安全領域最能體現能力與風險的兩難。Anthropic 並未專門用攻擊任務訓練 Opus 5,但模型綜合能力提高後,尋找程式碼漏洞的水準已接近 Mythos 5。然而在發現漏洞後的階段——編寫漏洞利用程式、將缺口轉化為實際攻擊手段——Opus 5 仍明顯落後。換句話說,Opus 5 很會檢查哪裡出問題,但真正發動攻擊的能力仍受到限制。Opus 5 可繼續檢查原始碼與尋找漏洞,但二進制漏洞掃描、滲透測試及漏洞利用程式生成則會被攔截。相比 Fable 5,新分類器觸發干預的頻率預計減少約 85%,正常安全研究更少被誤傷。觸發限制後,Claude.
ai、Claude Code 和 Claude Cowork 會預設改用 Opus 4.8 處理請求;加入網路安全驗證計畫的企業與研究人員,則可使用限制較少的版本。生物學領域也採用類似安排。Opus 5 成為 Anthropic 面向一般用戶開放的最強科研模型,但在需要長時間獨立運行的研究任務中仍有明顯限制。此前在 Fable 5 上因安全限制被攔截的生物學請求,現在會先轉交給 Opus 5 處理,使一般科研問題能用上更強模型,高風險任務則留在安全邊界之外。## 加量不加價,價格戰火一觸即發
從市場策略來看,Opus 5 可謂「加量不加價」。它延續 Opus 4.8 的定價,但完成率更高,單位任務成本反而下降。橫向對比,其最直接對手 OpenAI GPT-5.6 Sol 兩者輸入價格相同,Opus 5 輸出價格則低約 17%。在處理超長資料時,Opus 5 的價格優勢更為明顯。Anthropic 對最高 100 萬 Token 的上下文維持普通單價,而 GPT-5.6 Sol 的輸入超過 27.2 萬 Token 後,整次請求的輸入價格翻倍,輸出價格提高 50%。對於大型程式碼庫、長篇研究資料與複雜智慧體任務,這項差異將直接反映在帳單上。
Anthropic 這波操作無疑將進一步加劇 AI 模型市場的價格戰。Opus 5 現已成為 Claude Max 的全新預設型號,也是 Claude Pro 的最強型號。對於正在精打細算的企業用戶和開發者而言,Anthropic 正是以「旗艦級性能、中階價格」的姿態,向 OpenAI 的市場地位發起最猛烈的挑戰。而 OpenAI 執行長奧特曼此刻的「心理陰影面積」,恐怕不小。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。