Opus 5衝上第一,還需要Fable 5嗎?

2026年7月27日 09:02
Opus 5衝上第一,還需要Fable 5嗎?

重點摘要

Anthropic 在 7 月 25 日凌晨正式推出新一代模型 Claude Opus 5,沒有像以往那樣強調「最強模型」的稱號,而是給出更務實的定位:在複雜任務中較少遺漏步驟、更傾向主動驗證中間結果,並在多項評測中兼顧性能與成本,適合日常高頻使用。這一定位轉變也直接反映在產品配置上,目前 Opus 5 已成為 Claude Max 的預設模型,也是個人訂閱用戶(Max 與 Pro 方案)能調用的最強模型;而能力更高的 Fable 5 則主要面向 API 與企業客戶,個人用戶雖可使用但額度相當有限。

站內 AI 整理稿

Anthropic 在 7 月 25 日凌晨正式推出新一代模型 Claude Opus 5,沒有像以往那樣強調「最強模型」的稱號,而是給出更務實的定位:在複雜任務中較少遺漏步驟、更傾向主動驗證中間結果,並在多項評測中兼顧性能與成本,適合日常高頻使用。這一定位轉變也直接反映在產品配置上,目前 Opus 5 已成為 Claude Max 的預設模型,也是個人訂閱用戶(Max 與 Pro 方案)能調用的最強模型;而能力更高的 Fable 5 則主要面向 API 與企業客戶,個人用戶雖可使用但額度相當有限。 從官方公布的成績來看,Opus 5 在軟體工程、知識工作與智能體任務的完成效率上都有明顯提升,在多項軟體工程、商業流程與電腦操作評測中名列前茅。在最高思考檔位(max effort)下,部分成績甚至逼近甚至超越 Fable 5。不過,在進攻性網路利用與長週期自主生物研究等高風險場景中,受限的 Mythos 5 仍然更強。Opus 5 提供可調節的 effort(思考檔位),讓用戶能依照任務難度調整推理資源投入:檔位越高處理複雜問題能力越強,但速度較慢、Token 消耗也更多;調低檔位則可節省時間與成本。 目前 Opus 5 已在全平台上線,API 價格為每百萬 Token 輸入 5 美元、輸出 25 美元,與前一代 Opus 4.8 持平,約為 Fable 5 的一半。若追求速度可開啟 Fast 模式,以約兩倍價格換取 2.5 倍速度。Anthropic 同時上線兩項 Beta 功能:動態調整工具與自動回退,用以降低 Agent 任務因緩存失效導致成本上升、或因安全攔截而中斷的風險。 為了驗證 Opus 5 的實際表現,我們先看官方給出的成績單。在軟體工程測試中,Frontier-Bench v0.1 測試中 Opus 5 超過所有參測模型,成績比 Opus 4.8 提高一倍以上,單項任務成本反而更低。在 CursorBench 3.2 測試中,開啟 max effort 後,Opus 5 與 Fable 5 的成績相差不到 0.5%,但每項任務成本約為後者一半。在需要模型連續操作的任務中,Zapier AutomationBench 測試裡,按相同單項任務成本計算,Opus 5 通過率約為第二名 Fable 5 的 1.5 倍。在 OSWorld 2.0 測試中,它僅用 Fable 5 單項任務成本的略多於三分之一,就超過了後者最好成績。這些測試的共同點在於,不只考驗模型能否答對一道題,還包括能否調用工具、跨越多個步驟、發現錯誤並繼續推進任務。 在 ARC-AGI 3 測試中,主要考察模型處理陌生規則與新問題的能力,Opus 5 取得 30.2%,此前榜首是 GPT-5.6 Sol 的 7.8%。不過該成績取自 high 檔而非 max 檔,max 檔結果尚未公布。至少在此設定下,Opus 5 展現了較強的規則歸納、觀察與試錯能力。不過,Opus 5 並非在所有項目中都領先,Anthropic 公布的十餘項對比中,有四項落後其他模型。在 Humanity’s Last Exam 測試中,不用工具時 Opus 5 得 56.3%,略低於 Fable 5 的 56.5%;開放工具後 Opus 5 升至 64.7%,反超 Fable 5 的 63.9%。這更能說明兩者差異:Fable 5 仍有更強的純模型能力,Opus 5 則更擅長搜索、調用工具、檢查結果並持續推進任務。 Anthropic 披露的案例也符合這一特點。Opus 5 在沒有圖像查看工具的情況下,自行編寫計算機視覺程序,從機械圖紙的原始像素中提取數據;在缺少即時行情的情況下,主動搭建測試環境驗證交易所數據接口是否正確。從這些表現來看,Opus 5 此次升級的重點,與其說是純模型能力的躍升,不如說是執行、驗證與糾錯能力變得更成熟。當然,官方跑分需要謹慎看待,例如 Frontier-Bench 測試結果是在特定智能體框架下進行五次測試後取平均值,觸發安全分類器時還會由 Opus 4.8 接管,說明工具配置、提示詞與運行環境變化都可能影響結果。 第三方榜單的數據也提供參考。截至 7 月 25 日,Artificial Analysis 的智能指數榜單上,Opus 5 max 以 61 分排在第一位,僅高於第二名的 Fable 5 一分。該榜單綜合九項評測,比單看某個優勢項目更能反映綜合能力。由此可得出兩個結論:第一,Opus 5 進入當前第一梯隊,且在最高思考檔位下暫時排在榜首;第二,在各項測試中,Opus 5 並未與其他模型拉開明顯差距,沒有形成斷層優勢。因此,Opus 5 只是當前榜單上的領先者,跑分給出了能力上限,真實使用中的穩定性、Token 消耗與最終交付質量,才決定性價比究竟高不高。 模型上線後,評價很快兩極分化。正面評價集中在程式設計與可互動內容生成。有網友在 X 上分享 Opus 5 生成的可互動 3D 黑洞可視化器,還能即時合成一段電子音樂,代碼、視覺效果與聲音被整合進同一個成品,說明其快速製作產品原型的能力很強。也有網友將 Opus 5 與 Fable 5、GPT-5.6、Kimi K3 對比,認為它在 3D 製作上效果更好。但也有開發者認為,Opus 5 在部分任務中過度思考,推理過程很長,做到後面甚至會「我行我素」,偏離最初目標。有網友測試後稱,模型消耗了大量 Token,並佔用了較多上下文空間,卻沒有嚴格按照要求執行,更高的 effort 並不一定帶來更好的結果。 更系統的測試來自代碼審查平台 CodeRabbit,其結論是 Opus 5 更適合寫程式碼,而不是獨立承擔全部程式碼審查工作。它處理開放式、設計導向的任務時效果更好,但在邏輯錯誤、競爭條件與 API 誤用等問題上仍可能漏檢。獨立開發者李默將 Opus 5 形容為一個「做事靠譜,但略有個性的同事」。實際體驗中,其除錯能力很強,整體遠高於 Opus 4.8,也是 Fable 5 額度耗盡後的合適替代品。但 Opus 4 時代形成的工作流與提示詞不能直接遷移到 Opus 5,想獲得明顯提升,需要了解新模型習慣,調整任務拆分、effort 檔位與驗證方法。李默提到,兩個 Beta 功能直接改善了 Agent 開發體驗:過去改一次工具列表整段快取就作廢,現在對話中途換工具也不會失效;API 還可啟用自動降級,被安全分類器攔截的請求會自動轉交其他模型。 綜合來看,Opus 5 目前更像一名執行力強、願意自查,但還需要磨合的同事。它適合生成程式碼、修復問題與完成邊界清楚的工作,但在複雜規劃、長週期自主任務與部分文字表達上,Fable 5 仍有優勢。Anthropic 近期正在加快模型更新速度:5 月 29 日發布 Opus 4.8,6 月 10 日發布 Fable 5 與 Mythos 5,7 月 1 日上線 Sonnet 5,7 月 25 日發布 Opus 5,不到兩個月,Claude 的主要產品線幾乎更新了一遍。在密集發布模型的情況下,行業對模型應如何開放的分歧也在擴大。7 月 16 日月之暗面發布開放權重模型 Kimi K3,性能被認為已接近前沿。幾天後,OpenAI 戰略負責人在 X 上預測華盛頓會圍繞中國開放權重模型製造「監管風險」,這番話被廣泛解讀為對開源陣營的施壓。 Opus 5 發布當天,英偉達、Meta、微軟等 25 家公司和機構聯合發表公開信,呼籲美國政府不要過早限制開放權重模型,OpenAI、Anthropic 與 Google 沒有出現在簽署名單中。缺席不等於明確反對開放權重,但與開放權重相比,Anthropic 確實更強調閉源、分級開放與風險控制。6 月 12 日,美國政府對 Fable 5 與 Mythos 5 實施管制,兩款模型一度全面下線。限制解除後,Fable 5 恢復公開服務,安全限制更少的 Mythos 5 仍只向部分獲批機構開放。Opus 5 的定位,正嵌在 Anthropic 這套「模型該如何開放」的策略裡。它發現原始碼漏洞的能力接近 Mythos 5,但將漏洞轉化為實際攻擊工具的能力卻明顯較弱。對 Anthropic 而言,它不只是更便宜的 Fable 5 替代品,也是一個更容易在合規框架下向普通用戶與企業開放的選項。 與此同時,Anthropic 還在擴充算力。Opus 5 發布前兩天,公司宣布將部署最高 2 吉瓦規模的 AMD Instinct MI450 系列 GPU 與 Helios 機架級系統,首批 1 吉瓦計劃於 2027 年上半年開始部署。AMD 還承諾未來向 Anthropic 進行最高 50 億美元的戰略股權投資。從密集發布模型、擴充晶片供給,到精簡系統提示詞,Anthropic 做的不僅是提高跑分,而是把模型能力拆分到不同價格、風險與使用場景中:Fable 5 負責更複雜、更長週期的任務,Sonnet 5 承接成本敏感的普遍需求,Opus 5 則試圖成為開發者與知識工作者的日常默認選擇。因此,Opus 5 並沒有讓 Fable 5 失去意義。後者仍代表 Anthropic 公開可用的模型能力上限,Opus 5 解決的是如何以更低成本,把接近旗艦的能力交給更多用戶。它的競爭力在於能否以更穩定的表現、更少的人工接管與可以控制的成本,把一項工作真正完成。

Related

相關文章

OpenAI 和 Anthropic,正在砸錢搶這個市場

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報新智元·2026年07月27日 16:01八月的模型戰場,硝煙已經點燃 GPT-6和Fable 5.1,已經準備就位,很可能8月上線。 據悉,本週奧特曼已經突降華盛頓,展示了OpenAI有史以來的最強大模型——GPT-6。 據外媒Axios爆料,GPT-6 已經具備了進行原創科學研究的能力,並在內部測試中通過不休不眠的智能體集群(Agent Swarms),展現出危險的長程規劃與自主滲透能力。 而就在同一時刻,Anthropic這邊也有消息洩露:Fable 5.1 已經就位,瞄準 8 月,加量不加價,試圖以田忌賽馬戰術,在GPT-6落地前完成狙擊。 這個8月,註定不平靜,一場肉搏戰即將打響,目標直指ASI的奇點時刻。 Anthropic的暗中狙擊:Fable 5.1已準備好,等待一擊斃命 Anthropic 顯然已經嗅到奇點逼近的氣息。 業內爆料證實,Anthropic 籌備已久的 Fable 5.1 已經完成內部測試,瞄準 8 月發佈。 並且,它的定價將維持與Fable 5完全相同(輸入 $10 / 輸出 $50 每百萬 Token)。

剛剛

Claude Code狂刪80%提示詞,Opus 5反手加回去了

Anthropic 在 Claude Code 中刪除了 80% 的提示詞,但隨著更強大的 Opus 5 模型推出,這些提示詞不僅被全數恢復,還新增了更多規範,導致「模型越強、規矩越多」的現象。業界分析認為,這反映出 Anthropic 在提升模型能力與維持使用行為可控性之間的反覆權衡,後續提示工程反而走向更嚴謹複雜的路徑。

剛剛