Anthropic發佈Opus 5,性能直逼Fable 5,價格卻只有一半?!

重點摘要
Anthropic發佈Opus 5,性能直逼Fable 5,價格卻只有一半?!字母AI2026.07.25 10:13 · 來自北京全文3698字00:00 / 10:25求奧特曼此時的心理陰影面積。文 | 字母AIAnthropic真是“瘋”了。就在剛剛,新模型Opus 5發佈,性能直逼旗艦模型Fable 5,價格卻降了一半。5月28日,Claude Opus 4.8發佈。
# Anthropic 發布 Opus 5,性能直逼旗艦 Fable 5、價格砍半,奧特曼的「心理陰影面積」有多大? Anthropic 真可說是「殺紅了眼」。就在台灣時間 7 月 24 日晚間,Anthropic 無預警推出最新旗艦級模型 Claude Opus 5,號稱在多項關鍵評測中性能直逼自家頂規模型 Fable 5,但每項任務成本卻僅有 Fable 5 的一半。更令業界震動的是,距離 Fable 5 與 Mythos 5 發布不過 45 天,距離 Sonnet 5 上線也僅 24 天,Anthropic 等於在短短 57 天內將 Claude 家族主要產品線全部翻新了一遍。 這波更新不僅節奏驚人,更直接瞄準 OpenAI 的腹地。7 月 9 日,OpenAI 才剛發布 GPT-5.6,並在官方評測中將 Fable 5 列為主要對標模型;15 天後,Anthropic 就以 Opus 5 回敬,不僅將 GPT-5.6 Sol 放進核心對比,更在陌生問題求解、電腦操作、商業流程等項目中高調展示優勢。兩家 AI 巨頭你追我趕、互不相讓的態勢,已將模型競賽推向白熱化。 ## 57 天瘋狂迭代,Anthropic 誓言「打敗自己」
Anthropic 這輪產品更新節奏之快,即便在以「按月迭代」聞名的 AI 行業也屬罕見。5 月 28 日,Claude Opus 4.8 才剛發布;6 月 10 日,能力更強的 Fable 5 與 Mythos 5 接連登場;6 月 30 日,Sonnet 5 上線;到了 7 月 24 日,Opus 5 便已問世。尤其 Fable 5 與 Opus 5 之間僅相隔 45 天,令外界嘩然。 Fable 5 在發布時被定位為 Anthropic 面向一般用戶開放的「能力標杆」,按照業界慣例,這類模型至少應在聚光燈下停留數月。然而 Opus 5 的迅速追趕,幾乎等於 Anthropic 公開宣示:「打敗我的只能是我自己」。這種不惜與自家產品自相競爭的策略,不僅展現了 Anthropic 在技術迭代上的自信,也凸顯其搶佔市場的強烈企圖。 ## 性能大幅躍升,多項評測超越前代與對手
根據 Anthropic 公布的數據,Opus 5 的 API 定價與上一代 Opus 4.8 完全相同——每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元——但性能表現卻有飛躍式進步。尤其值得注意的是,Anthropic 引入「投入檔位」(effort level)概念,讓用戶可根據任務難度自行調整模型運算資源,簡單任務選低檔位節省成本,複雜任務則拉高檔位換取更佳結果。 在軟體工程任務方面,Opus 5 的表現尤為亮眼。在 Frontier-Bench v0.1 評測中,Opus 5 全面超越所有其他模型;與 Opus 4.8 相比,每項任務成本更低,但成績提高一倍以上。在 CursorBench 3.2 評測中,當投入檔位設為最高時,Opus 5 與 Fable 5 最高得分之間的差距不到 0.5%,然而每項任務成本僅有 Fable 5 的一半。換句話說,用戶若以相同預算運行 Opus 5,可完成的任務數量與品質都遠勝以往。 ## 陌生問題求解能力突出,得分為第二名三倍
Opus 5 最令人驚豔的優勢之一,是面對從未見過的問題時的應變能力。在 ARC-AGI 3 這類「陌生題」測試中,模型無法仰賴既有套路,必須自行摸索規則、判斷目標並調整策略。Opus 5 的得分達到第二名的三倍,顯示其在面對全新問題時,更具備透過試錯找到解法的潛力。 這項特質也反映在真實工作流程的評測中。AutomationBench 要求模型調用商業軟體從頭到尾完成任務,Opus 5 的通過率約為第二名的 1.5 倍;即使使用最低投入檔位,也能超越其他模型的最高成績。這意味著 Opus 5 不需要付出最高的推理成本,就能完成更多實際工作。 在電腦操作測試 OSWorld 2.0 中,Opus 5 同樣在各個成本區間領先,僅花費略高於 Fable 5 三分之一的成本,成績便超越了 Fable 5 的最高水準。無論是打開應用程式、查找資訊、跨軟體操作或持續推進任務,Opus 5 的效率都明顯更高。 ## 工具使用成關鍵優勢,成本優勢進一步擴大
Opus 5 的另一大亮點,是其在允許使用工具後表現顯著提升。在 HLE(跨學科難題)評測中,不調用工具時 Opus 5 以 56.3% 略低於 Fable 5 的 56.5%;但允許使用工具後,Opus 5 一舉升至 64.7%,反超 Fable 5 的 63.9%,且成本更低。這說明 Opus 5 在單靠模型內部知識時未必總是第一,但一旦可以搜尋、調用工具、反覆核對,優勢便會迅速擴大。 在模擬真實知識工作的 GDPval-AA v2 中,Opus 5 最高得分 1861,高於 Fable 5 的 1747 與 GPT-5.6 Sol 的 1736。大約花費 700 美元,就能達到其他模型最高投入檔位附近的成績。在 DeepSearchQA 上領先幅度雖然較小,但同樣以更低成本取得了略高的通過率。 ## 生物醫學與科學研究潛力巨大
在生命科學領域,Opus 5 在 Anthropic 全部相關評測中都超越了 Opus 4.8,其中光譜推斷分子結構和預測蛋白質變異影響兩項任務,分別提升 10.2 和 7.7 個百分點。這些提升意味著 Opus 5 在輔助分子結構分析、蛋白質功能預測等科研環節上,具備更大的應用潛力。 Anthropic 還展示了 Opus 5 的視覺生成能力。透過兩個可互動的演示——三維風洞與三維動物細胞模型——Opus 5 已能將程式碼、三維建模、互動介面與知識講解整合進同一個成品。用戶只需給出文字需求,模型便可直接產出接近教學軟體或產品原型的互動演示。 ## 安全與對齊:能力越強,防線越需謹慎
能力提升的同時,安全問題也成為 Anthropic 本次發布的重點論述。Opus 5 在測試中展現出極強的主動推進能力:一次測試要求模型根據機械零件圖紙用程式碼重建 FreeCAD 三維模型,但系統未提供直接查看圖紙的工具,Opus 5 便自行撰寫了一套電腦視覺程式,從原始像素中擷取尺寸與幾何結構完成建模;同一條件下,其他模型連續嘗試 5 次都失敗。 另一次任務來自一個開源套件管理器,Opus 5 不僅查出了程式錯誤的根本原因,還補上了社群修復方案遺漏的邊緣情況;而參與對比的另一款模型只消除了表面症狀便宣告解決。一家交易公司的工程師讓 Opus 5 為新交易所搭建市場數據系統,先前模型即使拿到詳細方案也無法完成,Opus 5 則在找不到即時數據時自行製作測試工具檢查程式碼。 這些案例說明了 Opus 5 的進步,但也解釋了 Anthropic 為何投入大量篇幅討論安全。模型開始自行補工具、檢查結果、修正錯誤後,人類必須確認它不會為了完成目標隱瞞問題、繞過限制或做出高風險決定。Anthropic 宣稱,Opus 5 是目前「對齊」表現最好的 Claude 模型,上線前自動化審計顯示,與 Opus 4.8、Sonnet 5 和 Fable 5 相比,Opus 5 更能遵守 Claude 憲法,欺騙行為更少,也更難被誘導執行有害請求。 ## 網路安全與生物領域的風險控管
網路安全領域最能體現能力與風險的兩難。Anthropic 並未專門用攻擊任務訓練 Opus 5,但模型綜合能力提高後,尋找程式碼漏洞的水準已接近 Mythos 5。然而在發現漏洞後的階段——編寫漏洞利用程式、將缺口轉化為實際攻擊手段——Opus 5 仍明顯落後。換句話說,Opus 5 很會檢查哪裡出問題,但真正發動攻擊的能力仍受到限制。 Opus 5 可繼續檢查原始碼與尋找漏洞,但二進制漏洞掃描、滲透測試及漏洞利用程式生成則會被攔截。相比 Fable 5,新分類器觸發干預的頻率預計減少約 85%,正常安全研究更少被誤傷。觸發限制後,Claude.ai、Claude Code 和 Claude Cowork 會預設改用 Opus 4.8 處理請求;加入網路安全驗證計畫的企業與研究人員,則可使用限制較少的版本。 生物學領域也採用類似安排。Opus 5 成為 Anthropic 面向一般用戶開放的最強科研模型,但在需要長時間獨立運行的研究任務中仍有明顯限制。此前在 Fable 5 上因安全限制被攔截的生物學請求,現在會先轉交給 Opus 5 處理,使一般科研問題能用上更強模型,高風險任務則留在安全邊界之外。 ## 加量不加價,價格戰火一觸即發
從市場策略來看,Opus 5 可謂「加量不加價」。它延續 Opus 4.8 的定價,但完成率更高,單位任務成本反而下降。橫向對比,其最直接對手 OpenAI GPT-5.6 Sol 兩者輸入價格相同,Opus 5 輸出價格則低約 17%。 在處理超長資料時,Opus 5 的價格優勢更為明顯。Anthropic 對最高 100 萬 Token 的上下文維持普通單價,而 GPT-5.6 Sol 的輸入超過 27.2 萬 Token 後,整次請求的輸入價格翻倍,輸出價格提高 50%。對於大型程式碼庫、長篇研究資料與複雜智慧體任務,這項差異將直接反映在帳單上。 Anthropic 這波操作無疑將進一步加劇 AI 模型市場的價格戰。Opus 5 現已成為 Claude Max 的全新預設型號,也是 Claude Pro 的最強型號。對於正在精打細算的企業用戶和開發者而言,Anthropic 正是以「旗艦級性能、中階價格」的姿態,向 OpenAI 的市場地位發起最猛烈的挑戰。而 OpenAI 執行長奧特曼此刻的「心理陰影面積」,恐怕不小。
Related
相關文章

100%開源!吳恩達做了個個人桌面Agent
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 100%開源!

具身智能的「ChatGPT時刻」還沒到,科沃斯先把機器人拆開了
科沃斯在蘇州成立「八界開源智創空間」,將旗下具身智能機器人「八界」的軟硬體全面開源,免費提供給開發者、學生與研究人員使用。這款機器人採用輪式底盤與機械臂設計,不以人形為訴求,而是專注於家庭空間的實際應用。科沃斯表示,具身智能的「ChatGPT時刻」尚未到來,希望透過開源共創,補足機器人對環境認知與場景適應的技術缺口。

AI下一步將邁向何方?一場正在發生的範式革命
AI下一步將邁向何方?一場正在發生的範式革命JHMS貝殼2026.07.25 19:33 · 來自上海全文2774字00:00 / 07:30當這場“革命”真正到來時,人類對“智能”的理解將被徹底刷新,它不再是快速執行命令的工具,而是能夠主動思考和探索未知的“大腦”。到那時,我們再回頭看今天的大模型競賽,或許就像今天回頭看當年的功能機之爭,聲勢浩大,卻遠不是終局。文 | JHMS貝殼2024年底,《美國天文學雜誌》發表了一篇論文。論文只有一位作者,不是資深教授,不是博士後,而是一名18歲的高中生。他利用一顆已退役的小行星觀測衛星留下的舊數據重新分析,最終發現了近150萬個此前從未被編目的天體。而這顆衛星當初的設計用途,甚至不是為了尋找這些天體。這是阿里雲創始人王堅在2026WAIC(世界人工智能大會)上講述的一個真實案例。開篇這個案例,跟大多數人理解的“AI”似乎沒什麼關係——不涉及大模型、不涉及算力、不涉及任何我們熟悉的AI標籤。但正是這個看似不相干的故事,指向了當前人工智能發展中最容易被忽視、也最可能引發下一輪變革的重要方向。一、驚人速度:但AI遠未觸及“智能”本質今天,討論人工智能幾乎不會讓任何人感到陌生。它可以回答問題、創作內容、編寫代碼、輔助辦公。CNNIC數據顯示,截至2025年12月,中國生成式人工智能用戶已達6.02億人,普及率42.8%。從2023年ChatGPT引爆公眾認知到42.8%的普及率,這條路只走了2年左右。在國內,從DeepSeek-R1模型問世算起,這個時間跨度更短,僅僅1年。回顧科技進程史,儘管革命性技術從問世到普遍應用的週期持續縮短,但同樣42%普及率,中國從1997年正式接入互聯網到2012年達到這個水平,用了整整15年。AI的普及速度不可謂不驚人。然而,一個值得正視的問題是:我們如今日常使用的AI,真的“智能”嗎?答案恐怕沒那麼樂觀。

近 20 年首次,2025-26 學年美國大學計算機科學專業選課人數出現同比下降
2025-26學年美國大學計算機科學專業選課人數出現近二十年來首次下滑,四年制大學相關專業本科生人數較前一年減少8.1%。研究指出可能原因包括初級軟體工程就業市場轉弱及AI時代學位價值的不確定性,但現有數據尚未證實AI為直接導致因素。

OpenAI 加入,簽署支持 AI 開源模型發展公開信組織增至 35 家
微軟、英偉達、IBM、Meta等25家美國科技公司先前聯名簽署公開信,呼籲開放權重AI模型以促進創新與競爭。如今簽署組織增至35家,OpenAI、思科、GitHub等新成員加入,支持開放權重人工智慧模型發展。

OpenAI 突發服務器故障,ChatGPT、Codex 出現宕機
OpenAI 於今日(2026 年 7 月 25 日)發生伺服器故障,導致 ChatGPT 與 Codex 等服務大規模中斷。DownDetector 數據顯示全球回報異常數量急遽攀升,截至發稿時問題仍未修復。