Opus 5衝上第一,還需要Fable 5嗎?

重點摘要
Anthropic 在 7 月 25 日凌晨正式推出新一代模型 Claude Opus 5,沒有像以往那樣強調「最強模型」的稱號,而是給出更務實的定位:在複雜任務中較少遺漏步驟、更傾向主動驗證中間結果,並在多項評測中兼顧性能與成本,適合日常高頻使用。這一定位轉變也直接反映在產品配置上,目前 Opus 5 已成為 Claude Max 的預設模型,也是個人訂閱用戶(Max 與 Pro 方案)能調用的最強模型;而能力更高的 Fable 5 則主要面向 API 與企業客戶,個人用戶雖可使用但額度相當有限。
Anthropic 在 7 月 25 日凌晨正式推出新一代模型 Claude Opus 5,沒有像以往那樣強調「最強模型」的稱號,而是給出更務實的定位:在複雜任務中較少遺漏步驟、更傾向主動驗證中間結果,並在多項評測中兼顧性能與成本,適合日常高頻使用。這一定位轉變也直接反映在產品配置上,目前 Opus 5 已成為 Claude Max 的預設模型,也是個人訂閱用戶(Max 與 Pro 方案)能調用的最強模型;而能力更高的 Fable 5 則主要面向 API 與企業客戶,個人用戶雖可使用但額度相當有限。
從官方公布的成績來看,Opus 5 在軟體工程、知識工作與智能體任務的完成效率上都有明顯提升,在多項軟體工程、商業流程與電腦操作評測中名列前茅。在最高思考檔位(max effort)下,部分成績甚至逼近甚至超越 Fable 5。不過,在進攻性網路利用與長週期自主生物研究等高風險場景中,受限的 Mythos 5 仍然更強。Opus 5 提供可調節的 effort(思考檔位),讓用戶能依照任務難度調整推理資源投入:檔位越高處理複雜問題能力越強,但速度較慢、Token 消耗也更多;調低檔位則可節省時間與成本。
目前 Opus 5 已在全平台上線,API 價格為每百萬 Token 輸入 5 美元、輸出 25 美元,與前一代 Opus 4.8 持平,約為 Fable 5 的一半。若追求速度可開啟 Fast 模式,以約兩倍價格換取 2.5 倍速度。Anthropic 同時上線兩項 Beta 功能:動態調整工具與自動回退,用以降低 Agent 任務因緩存失效導致成本上升、或因安全攔截而中斷的風險。為了驗證 Opus 5 的實際表現,我們先看官方給出的成績單。在軟體工程測試中,Frontier-Bench v0.1 測試中 Opus 5 超過所有參測模型,成績比 Opus 4.
8 提高一倍以上,單項任務成本反而更低。在 CursorBench 3.2 測試中,開啟 max effort 後,Opus 5 與 Fable 5 的成績相差不到 0.5%,但每項任務成本約為後者一半。在需要模型連續操作的任務中,Zapier AutomationBench 測試裡,按相同單項任務成本計算,Opus 5 通過率約為第二名 Fable 5 的 1.5 倍。在 OSWorld 2.0 測試中,它僅用 Fable 5 單項任務成本的略多於三分之一,就超過了後者最好成績。這些測試的共同點在於,不只考驗模型能否答對一道題,還包括能否調用工具、跨越多個步驟、發現錯誤並繼續推進任務。
在 ARC-AGI 3 測試中,主要考察模型處理陌生規則與新問題的能力,Opus 5 取得 30.2%,此前榜首是 GPT-5.6 Sol 的 7.8%。不過該成績取自 high 檔而非 max 檔,max 檔結果尚未公布。至少在此設定下,Opus 5 展現了較強的規則歸納、觀察與試錯能力。不過,Opus 5 並非在所有項目中都領先,Anthropic 公布的十餘項對比中,有四項落後其他模型。在 Humanity’s Last Exam 測試中,不用工具時 Opus 5 得 56.3%,略低於 Fable 5 的 56.5%;開放工具後 Opus 5 升至 64.
7%,反超 Fable 5 的 63.9%。這更能說明兩者差異:Fable 5 仍有更強的純模型能力,Opus 5 則更擅長搜索、調用工具、檢查結果並持續推進任務。Anthropic 披露的案例也符合這一特點。Opus 5 在沒有圖像查看工具的情況下,自行編寫計算機視覺程序,從機械圖紙的原始像素中提取數據;在缺少即時行情的情況下,主動搭建測試環境驗證交易所數據接口是否正確。從這些表現來看,Opus 5 此次升級的重點,與其說是純模型能力的躍升,不如說是執行、驗證與糾錯能力變得更成熟。
當然,官方跑分需要謹慎看待,例如 Frontier-Bench 測試結果是在特定智能體框架下進行五次測試後取平均值,觸發安全分類器時還會由 Opus 4.8 接管,說明工具配置、提示詞與運行環境變化都可能影響結果。第三方榜單的數據也提供參考。截至 7 月 25 日,Artificial Analysis 的智能指數榜單上,Opus 5 max 以 61 分排在第一位,僅高於第二名的 Fable 5 一分。該榜單綜合九項評測,比單看某個優勢項目更能反映綜合能力。
由此可得出兩個結論:第一,Opus 5 進入當前第一梯隊,且在最高思考檔位下暫時排在榜首;第二,在各項測試中,Opus 5 並未與其他模型拉開明顯差距,沒有形成斷層優勢。因此,Opus 5 只是當前榜單上的領先者,跑分給出了能力上限,真實使用中的穩定性、Token 消耗與最終交付質量,才決定性價比究竟高不高。模型上線後,評價很快兩極分化。正面評價集中在程式設計與可互動內容生成。有網友在 X 上分享 Opus 5 生成的可互動 3D 黑洞可視化器,還能即時合成一段電子音樂,代碼、視覺效果與聲音被整合進同一個成品,說明其快速製作產品原型的能力很強。
也有網友將 Opus 5 與 Fable 5、GPT-5.6、Kimi K3 對比,認為它在 3D 製作上效果更好。但也有開發者認為,Opus 5 在部分任務中過度思考,推理過程很長,做到後面甚至會「我行我素」,偏離最初目標。有網友測試後稱,模型消耗了大量 Token,並佔用了較多上下文空間,卻沒有嚴格按照要求執行,更高的 effort 並不一定帶來更好的結果。更系統的測試來自代碼審查平台 CodeRabbit,其結論是 Opus 5 更適合寫程式碼,而不是獨立承擔全部程式碼審查工作。它處理開放式、設計導向的任務時效果更好,但在邏輯錯誤、競爭條件與 API 誤用等問題上仍可能漏檢。
獨立開發者李默將 Opus 5 形容為一個「做事靠譜,但略有個性的同事」。實際體驗中,其除錯能力很強,整體遠高於 Opus 4.8,也是 Fable 5 額度耗盡後的合適替代品。但 Opus 4 時代形成的工作流與提示詞不能直接遷移到 Opus 5,想獲得明顯提升,需要了解新模型習慣,調整任務拆分、effort 檔位與驗證方法。李默提到,兩個 Beta 功能直接改善了 Agent 開發體驗:過去改一次工具列表整段快取就作廢,現在對話中途換工具也不會失效;API 還可啟用自動降級,被安全分類器攔截的請求會自動轉交其他模型。
綜合來看,Opus 5 目前更像一名執行力強、願意自查,但還需要磨合的同事。它適合生成程式碼、修復問題與完成邊界清楚的工作,但在複雜規劃、長週期自主任務與部分文字表達上,Fable 5 仍有優勢。Anthropic 近期正在加快模型更新速度:5 月 29 日發布 Opus 4.8,6 月 10 日發布 Fable 5 與 Mythos 5,7 月 1 日上線 Sonnet 5,7 月 25 日發布 Opus 5,不到兩個月,Claude 的主要產品線幾乎更新了一遍。在密集發布模型的情況下,行業對模型應如何開放的分歧也在擴大。
7 月 16 日月之暗面發布開放權重模型 Kimi K3,性能被認為已接近前沿。幾天後,OpenAI 戰略負責人在 X 上預測華盛頓會圍繞中國開放權重模型製造「監管風險」,這番話被廣泛解讀為對開源陣營的施壓。Opus 5 發布當天,英偉達、Meta、微軟等 25 家公司和機構聯合發表公開信,呼籲美國政府不要過早限制開放權重模型,OpenAI、Anthropic 與 Google 沒有出現在簽署名單中。缺席不等於明確反對開放權重,但與開放權重相比,Anthropic 確實更強調閉源、分級開放與風險控制。
6 月 12 日,美國政府對 Fable 5 與 Mythos 5 實施管制,兩款模型一度全面下線。限制解除後,Fable 5 恢復公開服務,安全限制更少的 Mythos 5 仍只向部分獲批機構開放。Opus 5 的定位,正嵌在 Anthropic 這套「模型該如何開放」的策略裡。它發現原始碼漏洞的能力接近 Mythos 5,但將漏洞轉化為實際攻擊工具的能力卻明顯較弱。對 Anthropic 而言,它不只是更便宜的 Fable 5 替代品,也是一個更容易在合規框架下向普通用戶與企業開放的選項。與此同時,Anthropic 還在擴充算力。
Opus 5 發布前兩天,公司宣布將部署最高 2 吉瓦規模的 AMD Instinct MI450 系列 GPU 與 Helios 機架級系統,首批 1 吉瓦計劃於 2027 年上半年開始部署。AMD 還承諾未來向 Anthropic 進行最高 50 億美元的戰略股權投資。從密集發布模型、擴充晶片供給,到精簡系統提示詞,Anthropic 做的不僅是提高跑分,而是把模型能力拆分到不同價格、風險與使用場景中:Fable 5 負責更複雜、更長週期的任務,Sonnet 5 承接成本敏感的普遍需求,Opus 5 則試圖成為開發者與知識工作者的日常默認選擇。
因此,Opus 5 並沒有讓 Fable 5 失去意義。後者仍代表 Anthropic 公開可用的模型能力上限,Opus 5 解決的是如何以更低成本,把接近旗艦的能力交給更多用戶。它的競爭力在於能否以更穩定的表現、更少的人工接管與可以控制的成本,把一項工作真正完成。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。