Claude Opus 5來了,Fable 5性能、一半價格

重點摘要
Anthropic 發布新一代旗艦大模型 Claude Opus 5,性能與 Fable 5 極為接近,但價格僅為一半。該模型在編程、科研及視覺輸出等任務表現優異,並強化自我校驗與安全性。網友對此評論:「既然性能差不多,何必花兩倍價格用 Fable 5?」
Anthropic 於今日凌晨正式推出新一代旗艦大語言模型 Claude Opus 5,這款模型主打「深思熟慮」與「主動響應」的雙重特性,在性能上極度逼近先前備受矚目的 Claude Fable 5,但價格僅為後者的一半。消息一出,立刻在社群平台上引發熱烈討論,有網友直指:「如果跟 Fable 5差不多,為什麼還要花兩倍的價格去用 Fable 5?」這也反映出市場對性價比的高度關注。 在定價方面,Claude Opus 5 延續了前代 Opus 4.8 的收費標準,輸入每百萬 Token 5 美元、輸出每百萬 Token 25 美元。開發者可以透過 API 中的 claude-opus-5 模型名稱進行調用。此外,Anthropic 還提供了快速模式(Fast mode),運行速度約為預設模式的 2.5 倍,但價格也相應提高至基礎價格的兩倍。這項設計讓用戶可以根據任務需求,在速度與成本之間取得平衡。 Anthropic 特別強調,Opus 5 專為日常高頻使用場景而設計,工作效率比以往任何一代模型都更高。目前它已成為 Claude Max 服務的預設模型,同時也是 Claude Pro 方案中性能最強的選項。這意味著一般用戶與企業開發者都能以更低的成本享受到接近頂尖水準的 AI 能力。 在模型性能表現上,Claude Opus 5 在多項權威評測中名列前茅。在編程與知識工作領域,它在 Frontier-Bench 與 GDPval-AA 等測試中達到了業界最佳(SOTA)成績。然而,在網路安全任務方面,它仍落後於專門強化的 Mythos 5。Anthropic 這次的發佈可謂「端水大師」,既充分展現了新模型的實力,又給 Fable 5 與 Mythos 5 保留了足夠的尊嚴。 具體來看,在高價值的軟體工程任務中,Opus 5 的表現尤為突出。在 Frontier-Bench v0.1 評估中,它不僅超越了所有其他模型,還在降低單項任務成本的同時,將性能提升至 Opus 4.8 的兩倍以上。而在 CursorBench 3.2 測試中,若將努力模式調至最高(Max Effort),其性能距離 Fable 5 的峰值僅差 0.5%,但單任務成本卻只有後者的一半。在 High、Xhigh 與 Max 三種努力模式下,Opus 5 在相同成本下的性能表現均優於其他所有模型。 除了軟體工程,Opus 5 在知識工作與複雜問題解決任務中也展現出顯著優勢。在 ARC-AGI 3 測試(評估模型解決全新未知問題的能力)中,它的得分是第二名模型的 3 倍。在 Zapier AutomationBench 上,相同單任務成本下,Opus 5 的通過率約為第二名模型的 1.5 倍。即使在最低努力設定下,它所完成的任務數量也超過了其他任何模型。在 OSWorld 2.0 計算機操作基準測試中,Opus 5 在任意給定成本下的表現均優於其他模型,僅需略高於三分之一的成本就能超越 Fable 5 的最佳成績。 對於科學研究領域,Opus 5 相比 Opus 4.8 帶來了全面躍升。在涵蓋結構生物學、有機化學與生物信息學等生命科學評估中,它的表現均優於前代。最顯著的突破包括:在有機化學任務中(如根據光譜數據推斷分子結構),內部基準測試得分比 Opus 4.8 高出 10.2 個百分點;在蛋白質相關任務中(如預測蛋白質序列變異對功能的影響),得分提升了 7.7 個百分點。此外,Opus 5 還具備大幅增強的視覺輸出生成能力,能繪製空氣動力學風洞風流圖解、細胞結構互動圖示等複雜圖形。 除了性能提升,Claude Opus 5 在自我校驗與迭代能力方面也有顯著進步。它能持續優化輸出直至任務成功,這正是當前業界高度關注的模型能力之一。在評測與早期測試中,湧現出多個典型案例:例如,在 Frontier-Bench 的一項任務中,模型收到一張機械零件圖紙,要求編寫程式碼在 FreeCAD 中重建 3D 模型,但系統刻意未提供直接查看圖紙的接口。Opus 5 竟然自行編寫了一套電腦視覺處理管線,從原始像素中提取幾何特徵,成功完成機械零件重建,多次重複實驗均告成功,而其他競爭模型嘗試五次無一成功。再如,面對一款熱門開源套件管理器中的真實 Bug,Opus 5 找到了根本原因並修復了社區補丁遺漏的邊緣情況,而競爭模型僅修復了表面症狀。某交易公司的工程師使用 Opus 5 在單次會話中為一個新交易所構建了市場數據接入源,由於當時沒有可用於驗證的即時數據源,Opus 5 甚至自己構建了一套測試套件來檢查程式碼是否準確解析數據。 業界知名人士也對 Opus 5 給予高度評價。Cognition 執行長 Scott Wu 提到,該模型在自家 Devin 軟體中處理困難問題的除錯與根因分析時表現出色。Zapier 執行長 Wade Foster 指出,Claude Opus 5 在未增加 Token 消耗的前提下拿下 Zapier AutomationBench 榜首,它讀取了一份原始客戶健康度表格,端到端執行了整套客戶流失預防流程,舊模型無法完成,Opus 5 卻百分之百成功。Lovable 聯合創辦人 Fabian Hedin 認為,這是 Opus 家族自 4.5 以來最大的一次飛躍。JetBrains IDE AI 負責人 Denis Shiryaev 則表示,Opus 5 最令人印象深刻的是其判別力與決策力,在寫下程式碼前會更深入思考,在規劃階段就能捕獲自己的邏輯缺陷,這是解題能力的一次重要跨越。 在安全性方面,Anthropic 的自動化行為審計顯示,Opus 5 是其迄今為止對齊程度最高的模型。它比 Opus 4.8、Sonnet 5 或 Fable 5 更符合《Claude's Constitution》,欺騙行為發生率最低,且最不容易被誤導或誘導濫用。在避免可能產生不可逆副作用的輕率行為方面,它是目前 Anthropic 最安全的模型。與 Opus 4.8 一樣,Anthropic 特意避免在網路攻防任務上訓練 Opus 5,但由於通用能力的提升,該模型在相關任務上仍有顯著增強,在尋找網路安全漏洞方面已逼近 Mythos 5。不過,在漏洞利用(將漏洞轉化為實質性威脅)方面,它仍大幅落後於 Mythos 5。網路安全分類器限制相對比 Fable 5 更加寬鬆,允許 Opus 5 在原始碼中查找漏洞,但會攔截基於二進制的漏洞掃描、滲透測試以及漏洞利用生成。遭攔截的請求會自動退回至 Opus 4.8。在生物領域,Opus 5 延續了與 Opus 4.8 類似的安全防護體系,被認為是目前可用於科學研究的最強通用模型。 此外,Anthropic 還更新了兩個處於測試階段的功能:對話中途更換工具時提示詞緩存不會失效,以及 API 自動降級處理,當請求被安全分類器標記時,系統會自動降級而非直接拒絕,從而減少用戶體驗中斷。 整體而言,Claude Opus 5 在性能與性價比上取得了雙重突破,特別是在編程、複雜推理與知識工作領域提升顯著,自我校驗與迭代能力也有所加強。當前國內開源與閉源模型頻繁更新,給海外大模型廠商帶來顯著壓力,不少海外科技巨頭逐漸轉向採用中國模型,加碼「性價比」或許將成為海外大模型廠商後續的重要策略之一。
Related
相關文章

100%開源!吳恩達做了個個人桌面Agent
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 100%開源!

具身智能的「ChatGPT時刻」還沒到,科沃斯先把機器人拆開了
科沃斯在蘇州成立「八界開源智創空間」,將旗下具身智能機器人「八界」的軟硬體全面開源,免費提供給開發者、學生與研究人員使用。這款機器人採用輪式底盤與機械臂設計,不以人形為訴求,而是專注於家庭空間的實際應用。科沃斯表示,具身智能的「ChatGPT時刻」尚未到來,希望透過開源共創,補足機器人對環境認知與場景適應的技術缺口。

AI下一步將邁向何方?一場正在發生的範式革命
AI下一步將邁向何方?一場正在發生的範式革命JHMS貝殼2026.07.25 19:33 · 來自上海全文2774字00:00 / 07:30當這場“革命”真正到來時,人類對“智能”的理解將被徹底刷新,它不再是快速執行命令的工具,而是能夠主動思考和探索未知的“大腦”。到那時,我們再回頭看今天的大模型競賽,或許就像今天回頭看當年的功能機之爭,聲勢浩大,卻遠不是終局。文 | JHMS貝殼2024年底,《美國天文學雜誌》發表了一篇論文。論文只有一位作者,不是資深教授,不是博士後,而是一名18歲的高中生。他利用一顆已退役的小行星觀測衛星留下的舊數據重新分析,最終發現了近150萬個此前從未被編目的天體。而這顆衛星當初的設計用途,甚至不是為了尋找這些天體。這是阿里雲創始人王堅在2026WAIC(世界人工智能大會)上講述的一個真實案例。開篇這個案例,跟大多數人理解的“AI”似乎沒什麼關係——不涉及大模型、不涉及算力、不涉及任何我們熟悉的AI標籤。但正是這個看似不相干的故事,指向了當前人工智能發展中最容易被忽視、也最可能引發下一輪變革的重要方向。一、驚人速度:但AI遠未觸及“智能”本質今天,討論人工智能幾乎不會讓任何人感到陌生。它可以回答問題、創作內容、編寫代碼、輔助辦公。CNNIC數據顯示,截至2025年12月,中國生成式人工智能用戶已達6.02億人,普及率42.8%。從2023年ChatGPT引爆公眾認知到42.8%的普及率,這條路只走了2年左右。在國內,從DeepSeek-R1模型問世算起,這個時間跨度更短,僅僅1年。回顧科技進程史,儘管革命性技術從問世到普遍應用的週期持續縮短,但同樣42%普及率,中國從1997年正式接入互聯網到2012年達到這個水平,用了整整15年。AI的普及速度不可謂不驚人。然而,一個值得正視的問題是:我們如今日常使用的AI,真的“智能”嗎?答案恐怕沒那麼樂觀。

近 20 年首次,2025-26 學年美國大學計算機科學專業選課人數出現同比下降
2025-26學年美國大學計算機科學專業選課人數出現近二十年來首次下滑,四年制大學相關專業本科生人數較前一年減少8.1%。研究指出可能原因包括初級軟體工程就業市場轉弱及AI時代學位價值的不確定性,但現有數據尚未證實AI為直接導致因素。

OpenAI 加入,簽署支持 AI 開源模型發展公開信組織增至 35 家
微軟、英偉達、IBM、Meta等25家美國科技公司先前聯名簽署公開信,呼籲開放權重AI模型以促進創新與競爭。如今簽署組織增至35家,OpenAI、思科、GitHub等新成員加入,支持開放權重人工智慧模型發展。

OpenAI 突發服務器故障,ChatGPT、Codex 出現宕機
OpenAI 於今日(2026 年 7 月 25 日)發生伺服器故障,導致 ChatGPT 與 Codex 等服務大規模中斷。DownDetector 數據顯示全球回報異常數量急遽攀升,截至發稿時問題仍未修復。