Claude Sonnet 5.5發佈:性能逼近Opus 5.5,價格減半,安全防護升級

更快、更便宜了。在推出旗艦級模型Claude Opus 5.5僅一週後,Anthropic又帶來了Claude 5.5家族的第二款產品。當地時間9月28日,Anthropic正式發佈Claude Sonnet 5.5。作為面向日常辦公、軟件開發等場景的主力模型,Sonnet 5.5在保持API名義價格不變的情況下,進一步提高了生成速度和任務執行效率。官方數據顯示,Sonnet 5.5的輸出生成速度提升超過30%。更具實際意義的是,在一些需要持續調用工具、反覆執行步驟的任務中,新模型通過減少冗餘推理和工具調用,將單項任務的綜合成本最高降低30%。性能上的變化同樣明顯。
在多項軟件工程、知識工作和計算機操作基準測試中,Sonnet 5.5已經逼近甚至超過Opus 5.5部分測試配置的成績。01 編程能力大幅提升,部分測試超過Opus 5.5 Anthropi官方基準測試對比圖 從Anthropic公佈的官方測試結果來看,Sonnet 5.5與上一代Sonnet 5之間的差距,在編程任務中最為明顯。在自主智能體編程測試Terminal-Bench 4.0中,Sonnet 5.5得分達到70.6%,上一代Sonnet 5僅為10.3%。這一表現甚至壓過了一週前發佈的Opus 5.5在高算力檔位(Xhigh)下的66.4%。Terminal-Bench 4.
0 基準測試:模型準確率與調用成本關係圖 在真實編輯器場景測試CursorBench 4.0中,Sonnet 5.5取得55.5%的成績,較Sonnet 5的34.1%明顯提升,與Opus 5.5的57.8%僅相差2.3個百分點。在高強度編程測試FrontierCode 1.1中,Sonnet 5.5在High努力等級下的成績比上一代高出10個百分點,同時單任務運行成本約為Sonnet 5的十五分之一。知識工作領域的表現同樣接近旗艦模型。在覆蓋44種職業真實工作場景的GDPval-AA v2.1測試中,Sonnet 5.
5獲得1844分,高於Sonnet 5的1449分和OpenAI GPT-6 Sol的1487分,與Opus 5.5的1846分幾乎持平。在跨學科推理測試Humanity's Last Exam的工具模式下,Sonnet 5.5取得64.5%的成績,高於Sonnet 5的54.9%,距離Opus 5.5的67.7%也只有3.2個百分點。Artificial Analysis 智能指數排名:Claude Sonnet 5.5 得分達 56 分 第三方評測也顯示出類似趨勢。大模型評測平臺Artificial Analysis的數據顯示,Sonnet 5.
5在其“智能指數”(Artificial Analysis Intelligence Index)中獲得56分,僅比Opus 5.5低2分;在最高推理努力模式下,其得分較上一代Sonnet 5提高18分。計算機操作能力同樣出現明顯提升。在OSWorld 2.1部分評估中,Sonnet 5.5準確率達到80.1%,較Sonnet 5的57.0%大幅提升,與Opus 5.5的81.8%相差不大。視覺理解方面,Sonnet 5.5在Chartography無工具模式下的準確率從上一代的15.6%提升至61.6%,超過GPT-6 Sol的53.6%,接近Opus 5.5的64.4%。
不過,推理投入並非越高越好。在FrontierCode測試中,Sonnet 5.5在最高算力檔位(Max模式)下的得分為46.2%,反而低於次高檔位(Xhigh模式)下的52.1%。Anthropic解釋稱,Max模式賦予了模型最高的推理自由度,但這更容易觸發頻繁的代碼審查以及子任務拆分;在部分場景中,過度思考反而導致任務超時或產生了超出範圍的代碼修改,最終影響了測試成績。這一結果也說明,在智能體任務中,額外增加推理和執行步驟並不一定帶來更高的任務完成度,如何控制計算量和執行路徑,同樣是模型優化的一部分。02 用更少Token幹更多活 Claude Sonnet 5.
5 與 Claude Opus 5.5 的 API 官方定價對比 相比性能提升,Sonnet 5.5此次更值得關注的變化,是成本結構。Sonnet 5.5的輸入、輸出和緩存寫入價格均為Opus 5.5的一半。其輸入價格為每百萬Token 2美元,輸出價格為每百萬Token 10美元,與GPT-6 Sol處於同一水平。相比之下,旗艦級Claude Opus 5.5的輸入價格為每百萬Token 4美元,輸出20美元;輕量級GPT-6 Luna的價格則進一步降至輸入每百萬Token 0.1美元、輸出0.5美元。
因此,Anthropic這次強調的並不只是“每百萬Token多少錢”,而是完成一項任務究竟需要消耗多少Token、調用多少次工具,以及花費多少時間。智能指數與單任務成本關係圖:Sonnet 5.5 在保持高智能得分的同時大幅降低了單任務成本 Artificial Analysis發佈的“智能指數與單任務成本關係圖”也顯示,Sonnet 5.5雖然單任務輸出Token數量較高,但憑藉較高的任務完成效率,其單任務成本仍處於較低水平。這意味著,對於Agent任務而言,單純比較每百萬Token價格,已經很難完整反映實際使用成本。在保持基礎價格不變的情況下,Anthropic強調,Sonnet 5.
5可以通過減少任務執行步驟和冗餘推理,降低實際任務成本。更頻繁地批處理工具調用,也有助於減少Agent執行過程中的額外開銷。Anthropic研究產品經理Theo Chu在接受CNBC採訪時表示,Sonnet主要面向對成本比較敏感、但並不需要頂級智能水平的客戶。對於大量日常、重複性的任務而言,用戶並不一定需要Opus級別的深度判斷能力。這也讓Sonnet 5.5與Opus 5.5之間的產品分工更加清晰:前者重點解決大量任務的效率和成本問題,後者則承擔對複雜性和判斷能力要求更高的工作。在此基礎上,提示詞緩存也進一步降低了重複任務的成本。
Anthropic提供最高90%的提示詞緩存摺扣,對於需要反覆處理相同上下文或長文檔的開發者而言,實際支出還可能進一步下降。一些早期測試反饋顯示,Sonnet 5.5在用戶界面重構、按照既定模板生成演示文稿等任務中表現較好,生成結果所需要的人工修改較少。03 安全機制也升級了 隨著模型代碼能力和智能體執行能力提升,安全問題也成為Sonnet 5.5此次升級的重要組成部分。Anthropic表示,由於Sonnet 5.5在網絡安全和滲透測試方面的能力出現明顯提升,該模型成為首款在發佈時即採用與Opus 5及Fable 5.1同等級別網絡安全防護機制的Sonnet模型。
其中一項機制是高風險請求重定向。當系統識別到高風險的網絡攻擊或滲透請求時,會將相關任務轉交給Sonnet 5處理,同時儘量避免影響正常的軟件開發和漏洞修復工作。第二項是針對模型蒸餾的數據提取防護分類器。Anthropic希望藉此減少競爭對手或惡意團隊通過大規模API查詢,系統性複製和提取模型內部能力的風險。此外,Anthropic還強調了合規與隱私能力。Sonnet 5.5符合歐盟AI法案相關水印要求,並繼續在AWS、Google Cloud、Microsoft Azure以及Anthropic官方API等渠道提供零數據保留選項。
對於Anthropic而言,模型能力提升的同時,安全控制也需要同步升級。04 Haiku 5.5隨後登場 隨著Sonnet 5.5發佈,Anthropic的Claude 5.5產品線已呈現出較為清晰的分工。Opus 5.5負責複雜推理、深度判斷和高難度任務;Sonnet 5.5則承擔軟件開發、辦公自動化以及大量需要智能體持續執行的日常任務;Haiku 5.5則將進一步覆蓋高吞吐、低成本的輕量級任務。Anthropic在官方公告中確認,Haiku 5.5將在未來幾周內推出。從這套產品佈局來看,Anthropic正在把模型之間的差異從單純的能力比拼,進一步擴展到任務類型、執行效率和使用成本。
Sonnet 5.5的出現,也讓Claude 5.5系列的產品分工更加清晰:Opus繼續承擔高難度任務,Sonnet負責更大規模的日常工作,Haiku則覆蓋對速度和成本更加敏感的場景。對Anthropic而言,接下來的競爭也將從單一模型的能力比拼,轉向模型性能、執行效率和使用成本之間的綜合較量。Sonnet 5.5能否憑藉這一思路進一步擴大企業用戶規模,還要看其進入真實生產環境後的表現。
Related
相關文章

Manus這次,直接衝著“人”去了
字母AI2026.09.29 16:47 · 來自北京全文4135字00:00 / 10:57一個Personal Agent 不過癮,Manus要配齊“秘書班子”。文 | 字母AIMuse剛把個人Agent推到聚光燈下,Manus就帶著它的“Agent團隊”回來了。

OpenAI因新模型太強叫停發佈
AGI計劃暫停。 程淺 發自 凹非寺 | 公眾號 QbitAI 原定於10月亮相的GPT-6.1 Astra突然被曝暫停發佈! 也就是說,OpenAI,三天連踩兩腳剎車。 而因為幾天前的DNS事件,OpenAI同時暫停了內部最強模型所有涉及工具調用的訓練、評測和推理。 關於此事件可以參考:啥題啊能幹崩OpenAI最強模型訓練。該事件被官方稱作Hugging face之後的首次模型失調事件。 這次暫停指向了模型訓練中的一個越發棘手的問題。

OpenAI明日重啟200美元Pro訂閱:API配額減半,取消5小時限制
這一策略調整標誌著其在大模型商業化路徑上的計費邏輯發生實質性轉變。官方說明指出,新版訂閱徹底解除了過往備受爭議的5小時使用時長限制,讓開發者與企業用戶得以完全自由支配每週配額。配額表面減半的背後,實質是底層模型推理效率的大幅躍升與API定價的階梯式下調。

AMD 82 億美元全股票吞下World Labs,李飛飛掛帥執行副總裁
更吸睛的是人——World Labs 聯合創始人、有著 AI 教母之稱的李飛飛,將加入 AMD 出任執行副總裁兼首席科學家,直接向蘇姿豐彙報。World Labs 是李飛飛等人於2024年聯合創辦的,主攻的方向叫世界模型:讓 AI 根據文本、圖像和視頻,生成或重建出能夠交互的3D 環境。

成立一年完成5輪融資,諾因智能再獲數億元,累計超10億元
諾因智能宣布完成數億元人民幣天使+++輪融資,由京東相關基金領投,累計融資額超過10億元人民幣。資金將用於擴充訓練數據、推進KNOWIN-X1本體量產準備並延攬人才。公司預計2027年第一季從技術進展走向消費市場,將具身大模型GLOW的「一教就會」能力帶入真實家庭。

OpenAI 提出前沿 AI 訓練安全指導原則:高級管理人員應有否決權
作者:清源 責編:清源 評論: 9 月 29 日消息,OpenAI 今天通過官方新聞稿提出了一套指導原則,要求企業在開展前沿 AI 強化學習訓練前提交結構化的安全論證文件。OpenAI 稱,安全論證應交由多名高級管理人員審查,每個人都應有權否決訓練任務,讓訓練在內部經過研究部門負責人或 VP(副總裁)、安全負責人和首席科學家等環節的多重把關。