Claude Opus 5來了,Fable 5性能、一半價格
重點摘要
智東西 作者 | 雲鵬 編輯 | 漠影 智東西7月25日早間報道,今天凌晨,Anthropic的新一代旗艦大模型Claude Opus 5正式發佈並上線,其兼顧“深思熟慮”與“主動響應”特點,在性能上極為接近Claude Fable 5,但價格只有一半。 此時網友祭出神評: “如果跟Fable 5差不多,那為什麼還要花2倍的價格用Fable 5?
# Claude Opus 5正式亮相:性能逼近Fable 5,價格僅一半引發市場熱議
智東西7月25日早間消息,今日凌晨,Anthropic正式發佈並上線了新一代旗艦大模型Claude Opus 5。這款新模型以兼顧「深思熟慮」與「主動響應」為核心特點,在性能上極為接近此前備受矚目的Claude Fable 5,但價格僅為後者的一半。這一策略迅速引發業界廣泛討論,更被網友戲稱為Anthropic的「端水大師」之作。消息一出,網友們立刻展開了熱烈討論。有網友祭出經典「老圖」調侃,也有人直言不諱地吐槽Anthropic最擅長的就是「重置」模型。更有用戶在使用後發現,Opus 5的寫作風格與Opus 4.8高度相似,與Fable 5完全不是同一個模式,尤其在用詞習慣上差異明顯。
部分網友因此認為,與其說這是Opus 5,不如稱之為「Fable 5.1」。還有人精準預測,各類科技文章很快就會湧現大量「教你用Opus 5」的內容,該帖子迅速獲得高讚。## 性能與性價比雙重突破,軟體工程表現尤為亮眼
一直以來,「貴」是網友對Claude系列最集中的吐槽點。而此次Opus 5的發佈,在維持與前代產品Opus 4.8相同成本的基礎上,實現了性能的大幅躍升。該模型配備了靈活的「思考程度/努力程度」(Effort)設置,用戶可根據需要自由調節,既可追求極致智能,也可節省Token以獲取更快速、更經濟的結果。在高價值的軟體工程任務中,Opus 5展現了令人矚目的實力。在Frontier-Bench v0.1測試中,它超越了所有其他模型,在降低單項任務成本的同時,性能達到了Opus 4.8的兩倍以上。在CursorBench 3.
2測試中,Opus 5在最高努力模式(Max Effort)下,性能距離Fable 5的峰值得分僅差0.5%,但單任務成本卻僅為後者的一半。在High、Xhigh和Max等不同努力模式下,Opus 5在相同成本條件下的性能表現均優於所有其他競爭模型。在知識工作與複雜問題解決領域,Opus 5同樣表現出色。在ARC-AGI 3測試中,該測試旨在考驗模型解決全新未知問題的能力,Opus 5的得分是第二名模型的3倍。在Zapier AutomationBench中,該測試衡量模型端到端完成商業自動化流程的能力,在相同單任務成本下,Opus 5的通過率約為第二名模型的1.5倍。
即便是在最低努力設置下,Opus 5通過的任務數也超過了其他任何模型。在OSWorld 2.0計算機操作使用基準測試中,Opus 5在任意給定成本下的表現均優於所有其他模型,僅需略高於三分之一的成本即可超越Fable 5的最佳成績。## 科學研究能力顯著提升,視覺輸出全面增強
對於科學研究領域而言,Opus 5帶來了比Opus 4.8更為顯著的進步。在涵蓋結構生物學、有機化學和生物信息學等領域的全部生命科學評估中,Opus 5的表現均超越Opus 4.8。其中最引人注目的突破體現在兩個方面:在有機化學任務中,例如根據光譜數據推斷分子結構,Opus 5在內部基準測試中的得分比Opus 4.8高出10.2個百分點;在蛋白質相關任務中,例如預測蛋白質序列變異對其功能的影響,其得分提升了7.7個百分點。 此外,Opus 5還具備了大幅增強的視覺輸出生成能力,能夠生成諸如空氣動力學風洞風流圖解、細胞結構互動圖示等高品質視覺內容。這意味著,對於需要同時處理文字、代碼與多模態資訊的高強度工作流,Opus 5正在成為一個更全面的工具。 ## 自我校驗與迭代能力躍升,業界大咖高度評價
Claude Opus 5在自我校驗與審慎迭代方面展現了顯著的提升,能夠持續優化直至任務成功,這也是當前業界高度關注的模型能力之一。在評估和早期測試中,團隊及測試用戶發現了許多體現Opus 5主動性與嚴謹性的典型實例。在Frontier-Bench的一項任務中,模型被要求接收一張機械零件圖紙,並編寫代碼在FreeCAD中重建3D模型。然而,該任務故意未提供直接查看圖紙的接口。面對這一限制,Opus 5自行編寫了一套計算機視覺處理管線,從原始像素中提取幾何特徵,最終成功完成了完整機械零件的重建,且在多次重複實驗中均取得成功。在相同設置下,其他競爭模型嘗試5次均未成功。
在另一個案例中,面對一款熱門開源包管理器中的真實Bug,Opus 5不僅找到了根本原因,還修復了社區補丁遺漏的邊緣情況;而競爭模型僅僅修復了表面症狀,並未觸及底層根因。一家交易公司的工程師使用Opus 5在單次會話中為一個新交易所構建了市場數據接入源,這項任務在舊模型完全無法完成的情況下,Opus 5甚至為自己構建了一套測試套件來驗證代碼是否準確解析了交易所數據。多位業內知名人士對Opus 5給予了高度評價。Cognition CEO Scott Wu指出,Opus 5在自家Devin軟體中針對困難問題的調試與根因分析任務表現出色。
Zapier CEO Wade Foster表示,Claude Opus 5在未增加Token消耗的前提下奪下了Zapier AutomationBench榜首。Lovable聯合創始人Fabian Hedin認為,Claude Opus 5是Opus家族自4.5以來最大的一次飛躍。JetBrains IDE AI負責人Denis Shiryaev則強調,Opus 5在寫下代碼前會更深入地思考,在規劃階段就能捕獲自己的邏輯缺陷,這是解題能力的一次重要跨越。## 安全對齊持續強化,防護策略精細化
在安全方面,Anthropic投入了大量精力進行部署前的測試。自動化行為審計結果顯示,Opus 5是目前為止Anthropic對齊程度最高的模型。它比Opus 4.8、Sonnet 5或Fable 5更符合《Claude's Constitution》,欺騙行為發生率最低,且最不容易被誤導或誘導濫用,在避免可能產生不可逆副作用的輕率行為方面,是當前Anthropic生態中最安全的模型。值得注意的是,Anthropic特意避免了在網絡攻防任務上訓練Opus 5,但由於通用能力的提升,該模型在相關任務上的表現仍有顯著增強,在尋找網絡安全漏洞方面已逼近Mythos 5。
然而,在漏洞利用方面,即將漏洞轉化為實質性網絡威脅的能力,它依然大幅落後於Mythos 5。具體到網絡安全策略,Opus 5的安全分類器限制相對Fable 5更為寬鬆,允許Opus 5在源代碼中查找漏洞,但會攔截基於二進制的漏洞掃描、滲透測試以及漏洞利用生成。針對被攔截的請求,系統默認會自動退回至Opus 4.8處理。在生物領域,Opus 5延續了與Opus 4.8類似的安全防護體系,同時被認為是目前可用於科學研究的最強通用模型,這在一定程度上回應了外界對AI在雙重用途研究(DURC)風險上的擔憂。## 定價策略與API功能更新,開發者體驗優化
價格方面,Claude Opus 5定價為輸入每百萬Token 5美元、輸出每百萬Token 25美元,與Opus 4.8定價持平。開發者可在API中使用claude-opus-5進行調用。同時,快速模式(Fast mode)運行速度約為默認速度的2.5倍,價格為基礎價格的2倍,為需要即時響應的開發者提供了靈活選擇。此外,Claude還更新了兩個處於測試階段的功能:對話中途更換工具時提示詞緩存不失效,以及API自動降級處理功能。後者意味著當遇到被安全分類器標記的請求時,系統不再直接拒絕,而是嘗試進行降級處理,避免請求直接被攔截。
Anthropic表示,Opus 5專為日常高頻使用設計,比以往模型的工作效率更高,已成為Claude Max的新默認模型,同時也是Claude Pro中性能最強的模型。## 全球AI競爭加劇,性價比或成關鍵賽道
當前,國內開源與閉源大模型接連迎來重大更新,給海外大模型廠商帶來了顯著的市場壓力。不少海外科技巨頭已逐步轉向採用中國模型,以降低成本、提高性價比。在此背景下,Anthropic此次推出的Opus 5,不僅在核心的編程、複雜推理和知識工作中實現了顯著提升,更在性價比上做出了積極回應。 從市場反應來看,Claude Opus 5的發佈不僅是一次技術性能的迭代,更標誌著Anthropic正在調整其戰略方針——從單純追逐參數規模與性能極致,轉向在保持高水準的同時,更加注重產品化、安全性與實際開發者的使用成本。這種「性價比」路線,或許將成為海外大模型廠商在未來市場競爭中的重要策略之一,也將進一步加劇全球AI大模型市場的競爭格局。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。