IT之家生成式AI

Anthropic Opus 5 發佈:性能逼近 Fable 5 但價格砍半,刷新 ARC-AGI-3 紀錄

2026年7月24日 06:42
Anthropic Opus 5 發佈:性能逼近 Fable 5 但價格砍半,刷新 ARC-AGI-3 紀錄

重點摘要

Anthropic 發布 Claude Opus 5 旗艦模型,效能接近更高規格的 Fable 5,但價格僅為一半,並在 ARC-AGI-3 測試中大幅領先其他模型。該模型在程式碼、知識工作及科學研究等領域表現出色,已成為 Claude Max 服務的預設模型。

站內 AI 整理稿

Anthropic 今日正式推出 Opus 系列最新旗艦模型——Claude Opus 5,這款模型在性能上較前代 Opus 4.8 顯著提升,但價格維持不變。官方表示,Opus 5 定位為適合日常使用的高效能模型,在部分能力上已接近更高規格的 Claude Fable 5,然而價格僅約後者的一半。目前 Opus 5 已成為 Claude Max 服務的預設模型,同時也是 Claude Pro 用戶所能使用的最高等級模型,在多項程式碼、知識工作與科學研究測試中皆達到當前最佳水準。 根據 Anthropic 公布的評測結果,Opus 5 在 Frontier-Bench、GDPval-AA 等程式碼與知識工作基準測試中取得領先。在 Frontier-Bench v0.1 測試中,Opus 5 不僅超越其他模型,相較 Opus 4.8 更將任務性能提升超過一倍,同時每項任務的成本更低。在 CursorBench 3.2 測試中,Opus 5 在最高努力模式下的表現僅比 Fable 5 峰值低 0.5%,但每項任務的成本約為 Fable 5 的一半。此外,無論在高、中高或最高努力設定下,Opus 5 在單位成本性能方面均優於其他模型。 在知識處理與問題解決能力方面,Opus 5 在 ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0 等評測中均獲得高分。其中,在 ARC-AGI 3 測試中,Opus 5 的得分約為第二名的三倍;而在衡量模型完成完整業務流程能力的 Zapier AutomationBench 中,其通過率約為成本相近模型的 1.5 倍。這些成績顯示 Opus 5 在複雜推理與自動化任務上的強大實力。 Anthropic 指出,Opus 5 在科研任務中也有明顯進步,涵蓋結構生物學、有機化學、生物資訊學等領域。舉例來說,在有機化學任務中,模型需根據光譜數據推斷分子結構,Opus 5 的表現比 Opus 4.8 高出 10.2 個百分點;在預測蛋白質序列變化對功能影響的任務中,則高出 7.7 個百分點。這些提升對學術研究與醫藥開發具有實際意義。 在實際應用層面,Anthropic 強調 Opus 5 在驗證自身結果與持續迭代修正方面的能力更強。例如,在一項測試中,模型需要根據機器零件圖紙生成 FreeCAD 三維模型,但無法直接查看圖紙內容。Opus 5 自行編寫電腦視覺流程,從原始像素中提取幾何資訊,並成功完成模型重建。另一項測試中,Opus 5 發現了一個開源軟體套件管理程式中的實際漏洞,並修復了社群補丁遺漏的問題。此外,一名交易公司的工程師使用 Opus 5 在一次會話中建構了一個新交易所的數據介面,在缺乏即時數據源驗證的情況下,模型還自行建立測試工具檢查程式碼解析結果。 安全方面,Anthropic 表示 Opus 5 的安全限制比 Fable 5 更少,預計安全分類器的觸發次數會比 Fable 5 減少約 85%。不過,Opus 5 仍針對部分高風險場景設置限制。例如,在網路安全領域,模型可以協助分析原始碼中的漏洞,但會阻止基於二進位檔案的漏洞掃描、滲透測試以及漏洞利用程式碼生成等操作。Anthropic 說明,Opus 5 並未經過專門的網路攻擊任務訓練,但隨著整體能力提升,其漏洞發現能力有所增強。在 OSS-Fuzz 測試中,Opus 5 與 Mythos 5 在漏洞發現方面表現接近,但在將漏洞轉化為實際攻擊工具方面仍明顯落後於 Mythos 5。在生物領域,Opus 5 延續 Opus 4.8 的安全機制,目前是 Anthropic 面向公眾開放的能力最強科研模型。不過,Anthropic 認為,Opus 5 在長時間、自主執行科研任務方面仍存在限制,而這類任務被認為可能帶來更高風險。 價格方面,Claude Opus 5 已透過 Anthropic 各平台上線,輸入價格為每百萬個詞元(token)5 美元(約合新台幣 165 元或人民幣 33.9 元),輸出價格為每百萬個詞元 25 美元(約合新台幣 825 元或人民幣 169.6 元),與 Opus 4.8 保持一致。開發者可透過 Claude API 呼叫 claude-opus-5。此外,Anthropic 還推出了 Opus 5 Fast 模式,運行速度約為預設模式的 2.5 倍,價格為基礎價格的兩倍。 同時,Anthropic 開放測試兩項新功能:一是在 Claude 平台中允許對話中途切換工具,二是在 API 中提供自動回退功能。自動回退功能讓用戶在安全分類器攔截請求時,可將任務自動轉交給其他可用模型處理,避免直接返回錯誤訊息。Anthropic 表示,Opus 5 與此前 Opus 系列模型一樣,面向一般用戶開放時不設置數據保留要求。整體而言,Opus 5 以接近旗艦 Fable 5 的性能、僅一半的價格,以及多項突破性評測成績,成為當前 AI 模型市場中極具競爭力的選擇。

Related

相關文章

量子位生成式AI

具身智能的「ChatGPT時刻」還沒到,科沃斯先把機器人拆開了

科沃斯在蘇州成立「八界開源智創空間」,將旗下具身智能機器人「八界」的軟硬體全面開源,免費提供給開發者、學生與研究人員使用。這款機器人採用輪式底盤與機械臂設計,不以人形為訴求,而是專注於家庭空間的實際應用。科沃斯表示,具身智能的「ChatGPT時刻」尚未到來,希望透過開源共創,補足機器人對環境認知與場景適應的技術缺口。

1 小時前
鈦媒體生成式AI

AI下一步將邁向何方?一場正在發生的範式革命

AI下一步將邁向何方?一場正在發生的範式革命JHMS貝殼2026.07.25 19:33 · 來自上海全文2774字00:00 / 07:30當這場“革命”真正到來時,人類對“智能”的理解將被徹底刷新,它不再是快速執行命令的工具,而是能夠主動思考和探索未知的“大腦”。到那時,我們再回頭看今天的大模型競賽,或許就像今天回頭看當年的功能機之爭,聲勢浩大,卻遠不是終局。文 | JHMS貝殼2024年底,《美國天文學雜誌》發表了一篇論文。論文只有一位作者,不是資深教授,不是博士後,而是一名18歲的高中生。他利用一顆已退役的小行星觀測衛星留下的舊數據重新分析,最終發現了近150萬個此前從未被編目的天體。而這顆衛星當初的設計用途,甚至不是為了尋找這些天體。這是阿里雲創始人王堅在2026WAIC(世界人工智能大會)上講述的一個真實案例。開篇這個案例,跟大多數人理解的“AI”似乎沒什麼關係——不涉及大模型、不涉及算力、不涉及任何我們熟悉的AI標籤。但正是這個看似不相干的故事,指向了當前人工智能發展中最容易被忽視、也最可能引發下一輪變革的重要方向。一、驚人速度:但AI遠未觸及“智能”本質今天,討論人工智能幾乎不會讓任何人感到陌生。它可以回答問題、創作內容、編寫代碼、輔助辦公。CNNIC數據顯示,截至2025年12月,中國生成式人工智能用戶已達6.02億人,普及率42.8%。從2023年ChatGPT引爆公眾認知到42.8%的普及率,這條路只走了2年左右。在國內,從DeepSeek-R1模型問世算起,這個時間跨度更短,僅僅1年。回顧科技進程史,儘管革命性技術從問世到普遍應用的週期持續縮短,但同樣42%普及率,中國從1997年正式接入互聯網到2012年達到這個水平,用了整整15年。AI的普及速度不可謂不驚人。然而,一個值得正視的問題是:我們如今日常使用的AI,真的“智能”嗎?答案恐怕沒那麼樂觀。

1 小時前