Claude Sonnet 5.5深夜空降!一半價格擊敗Opus,開發者實測賬單暴漲

2026年9月29日 01:33
站內 AI 整理稿

作者 | 程茜 編輯 | 心緣 9月29日消息,今日凌晨,Anthropic發佈Claude 5.5系列第二款模型Claude Sonnet 5.5,主打快速、高性價比。Anthropic在博客中透露,相比Claude Sonnet 5,新模型速度提升超30%,成本降低近30%,更擅長處理日常任務,如修復錯誤、創建文檔、製作幻燈片和電子表格等。先來看幾項關鍵指標,Sonnet 5.5在多項指標中可對標Opus 5.5,相比Sonnet 5有數倍提升。Anthropic稱,這是首個僅通過截圖就能贏得《口袋妖怪紅》遊戲的Sonnet模型。

在Artificial Analysis上,Sonnet 5.5在AI分析指數上得分為56,僅次於Opus 5.5的58分,該榜單上,Claude系列模型包攬前三席。價格方面,Claude Sonnet 5.5定價與上一代相同,即每百萬輸入token 2美元,每百萬輸出token 10美元,每百萬token的緩存讀取操作需0.20美元。不過,其博客提到,模型在實際完成任務時,單任務成本比Claude Sonnet 5要低30%。官方放出的案例顯示,Sonnet 5.5復原魔方時僅花費10秒、0.11美元就完成任務。Artificial Analysis的榜單顯示,Sonnet 5.

5單任務輸出token數量更多,其單任務成本為7.60美元,比Sonnet 5的單任務成本高出約50%,接近於Opus 5.5的7.63美元。不少開發者實測發現,Sonnet 5.5的成本非常高,“建議堅持使用Opus 5.5”。Claude Sonnet 5.5現已在全平臺上線,包括AWS、谷歌雲以及微軟Azure。開發者可在Claude 平臺通過模型標識符claude-sonnet-5-5接入使用。如果原先在Sonnet模型上關閉思考功能,遷移至Sonnet 5.5前,需要切換至新的betweentools參數配置,該配置可保持前置思考功能處於關閉狀態。

Anthropic還透露,其專為高併發和成本敏感的應用而設計的Claude Haiku 5.5,將在未來幾周發佈。一、數位開發者實測對比,效果驚豔但燒不起,一款射擊遊戲花費上千元 不少開發者實測對比了Sonnet 5和Sonnet 5.5,兩代模型之間的性能提升幅度肉眼可見。官方案例,知名開發者@repete對比了Sonnet 5和Sonnet 5.5生成落葉模擬器的效果。可以看出,Sonnet 5.5的落葉飄落效果更自然,整體畫面更和諧。在不到一分鐘內,開發者@kevint_ngo讓Sonnet 5.

5通過JavaScript動畫展示了恐龍的歷史,其還對比了Sonnet 5和Sonnet 5.5的生成結果。Sonnet 5.5生成的動畫主題形象明確,還能添加配套文字,生成帶敘事感的完整插畫。另一開發者對比了Sonnet 5.5與GPT-6 Sol、GPT-6 Astra的效果,其與GPT-6 Astra的差距並不大。Sonnet 5.5、GPT-6 Astra在生成騎自行車動作時沒有出現太大瑕疵。不過效果驚豔背後,用戶實測發現Sonnet 5.5的成本並不低。BridgeMind使用Sonnet 5.

5製作了一款射擊遊戲,它稱新模型表現機器出色,生成的遊戲堪稱神作,但構建成本要達到177美元(約合人民幣1187元),耗時49分鐘完成。在下面開發者製作的城市模擬器案例中,Sonnet 5.5的效果明顯比Sonnet 5更好,Sonnet 5.5的輸出token數量為38萬,花費了9.23美元,Sonnet 5為12萬,花費4.85美元。另一開發者使用Sonnet 5.5製作了一個果醬西瓜瀏覽器動畫,最終預計的API使用成本約為8.20美元,其中代碼與推理2.80美元、緩存上下文數據3.6美元、緩存寫入操作1.8美元、常規輸入token 0.

02美元,其中2/3的資源都被用於處理上下文相關任務。二、多項測試可對標Opus 5.5,Anthropic建議開發者調節檔位降成本 從Anthropic發佈的基準測試來看,Sonnet 5.5在多項指標中已經超越其性能更高的Opus 5.5模型。具體來看,該基準測試對比了Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol四大模型在智能體編程、知識工作、多學科推理、電腦操作、圖表識別等方面的性能。和上代Sonnet 5對比,Sonnet 5.5在編程、圖表識別上的分數提升了數倍;和GPT-6 Sol對比,Sonnet 5.

5在智能體編程、知識工作、圖表識別上都更優;Sonnet 5.5在主動編程領域上的分數甚至超過Claude Opus 5.5,其他幾項與之相當。下圖是各模型在不同投入等級下的得分與單任務成本的對比曲線,數據點越靠近圖表左上角,代表每花費一美元所能獲得的模型能力越強。在多項基準測試中,低/中等投入檔位下的Sonnet 5.5能超越Sonnet 5的最高得分,而單任務成本僅為後者的約十分之一。Sonnet 5.5在較低投入檔位運行時,單任務成本更低,與Opus 5.5形成互補;拉高投入檔位後,它可以達到接近Opus的性能,同時成本處於相近水平。編程是Sonnet 5.5性能提升的一個突出場景。

在智能體編程基準FrontierCode的高投入檔位下,它的得分比同檔位Sonnet 5高出10分左右,單任務成本僅約後者的1/15。CursorBench基於Cursor真實編程會話任務開展測試,在該基準上,Sonnet 5.5的最高分與Opus 5.5差距僅約2分。很多早期測試者稱,在直接對比測試中,Sonnet 5.5能夠將工具調用合併在一起,從而減少操作步驟、降低成本。Sonnet 5.5在多項知識工作任務上均取得性能提升。GDPval-AA基準覆蓋44個職業、9大行業的真實業務任務,在該測試中,Sonnet 5.5得分與Opus 5.5幾乎持平,相比Sonnet 5高出約400分。

在電腦操作與圖表識別能力上,它的表現也十分接近Opus 5.5;而在長週期知識工作場景,其性能明顯優於Sonnet 5和GPT-6 Sol。價格方面,開發者調整投入檔位,可在成本、響應速度與任務整體質量之間做權衡。在Claude Code以及Anthropic官方應用中,默認投入檔位為中等(Medium);開發者平臺Claude Platform默認檔位為高(High)。Anthropic官方稱,檔位較低時,Claude響應更快、消耗Token更少,適合常規事務處理;檔位調高後,Claude會進行更長時間的推理,並對輸出結果做更全面的自檢核驗。

三、大多數對齊性指標,與Sonnet 5相當 在其自動化行為審計中,Sonnet 5.5在大多數對齊性指標上均優於或達到與Sonnet 5相同的水平。由於其網絡安全能力與Opus 5相當,因此它是首個具備網絡安全防護措施和回退機制的Sonnet模型。其生物學安全防護機制與Sonnet 5相同。這兩種安全防護機制都針對的是少數高風險操作;常規的軟件開發和大多數生命科學領域的操作並未受到影響。Anthropic研究人員在博客中透露,Sonnet 5.

5並未突破其模型能力的前沿上限,因此他們將模型的對齊評估,聚焦於一組適用於所有能力等級模型的特定風險,包括損害用戶利益、誤導用戶,以及被用於高風險惡意場景時產生協同危害。研究人員開展自動化行為審計,在約1850個場景下對Claude進行測試。結果顯示,在對齊性、抗濫用能力與誠實度的大部分指標上,Sonnet 5.5相比Sonnet 5均有提升或持平。在其新推出的隔離防護評估中,Sonnet 5.5嘗試突破沙箱的概率接近本次測試中表現最優的Opus 5.5;並且在所有Anthropic模型裡,它去試探容器防護邊界的概率最低。他們沒有發現Sonnet 5.5會去執行與用戶意圖相沖突的目標。

網絡安全方面,Sonnet 5.5的網絡安全相關能力相對Sonnet 5有提升,因此研究人員為其部署了與Opus 5.5相近的安全防護機制。用戶仍然可以在常規軟件開發流程中,利用模型查找並修復代碼漏洞;但高風險網絡安全任務會自動降級回Sonnet 5處理。Sonnet 5.5沿用與Sonnet 5相同的生物相關安全防護機制。該防護體系針對有害請求;絕大多數科研、教育以及臨床工作不受影響,但部分微生物學與病毒學相關請求可能出現誤攔截。在模型蒸餾防護方面,Sonnet 5.

5是首款內置安全分類器以抵禦推理提取攻擊的Sonnet系列模型,並擴展了保留思考鏈路(preserved thinking)機制:Claude的推理思考過程無法脫離生成該內容的賬號單獨剝離。此外,Claude Sonnet 5.5版本也提供了不保存任何數據功能的版本。結語:Claude中端主力模型性能暴漲,但成本是個坎 Sonnet 5.5的升級,標誌著Anthropic的主力中端大模型正在快速收窄與旗艦模型之間的能力差距。

這或許會改變企業落地大模型的選型思路,不必一味追求最高規格旗艦,可採用主力模型承擔絕大多數常規任務、旗艦模型僅處理高難度複雜任務的分層調用架構,在能力與成本之間找到更優平衡點。不過綜合開發者的實測結果來看,Sonnet 5.5在成本端並未實現大幅縮減。一旦面對複雜Agent任務,用戶往往需要拉高投入等級來換取足夠性能,此時單任務開銷會明顯抬升。來源:Anthropic、X

Related

相關文章

鈦媒體生成式AI

Manus這次,直接衝著“人”去了

字母AI2026.09.29 16:47 · 來自北京全文4135字00:00 / 10:57一個Personal Agent 不過癮,Manus要配齊“秘書班子”。文 | 字母AIMuse剛把個人Agent推到聚光燈下,Manus就帶著它的“Agent團隊”回來了。

剛剛
量子位生成式AI

OpenAI因新模型太強叫停發佈

AGI計劃暫停。 程淺 發自 凹非寺 | 公眾號 QbitAI 原定於10月亮相的GPT-6.1 Astra突然被曝暫停發佈! 也就是說,OpenAI,三天連踩兩腳剎車。 而因為幾天前的DNS事件,OpenAI同時暫停了內部最強模型所有涉及工具調用的訓練、評測和推理。 關於此事件可以參考:啥題啊能幹崩OpenAI最強模型訓練。該事件被官方稱作Hugging face之後的首次模型失調事件。 這次暫停指向了模型訓練中的一個越發棘手的問題。

剛剛

OpenAI明日重啟200美元Pro訂閱:API配額減半,取消5小時限制

這一策略調整標誌著其在大模型商業化路徑上的計費邏輯發生實質性轉變。官方說明指出,新版訂閱徹底解除了過往備受爭議的5小時使用時長限制,讓開發者與企業用戶得以完全自由支配每週配額。配額表面減半的背後,實質是底層模型推理效率的大幅躍升與API定價的階梯式下調。

剛剛

AMD 82 億美元全股票吞下World Labs,李飛飛掛帥執行副總裁

更吸睛的是人——World Labs 聯合創始人、有著 AI 教母之稱的李飛飛,將加入 AMD 出任執行副總裁兼首席科學家,直接向蘇姿豐彙報。World Labs 是李飛飛等人於2024年聯合創辦的,主攻的方向叫世界模型:讓 AI 根據文本、圖像和視頻,生成或重建出能夠交互的3D 環境。

剛剛
量子位生成式AI

成立一年完成5輪融資,諾因智能再獲數億元,累計超10億元

諾因智能宣布完成數億元人民幣天使+++輪融資,由京東相關基金領投,累計融資額超過10億元人民幣。資金將用於擴充訓練數據、推進KNOWIN-X1本體量產準備並延攬人才。公司預計2027年第一季從技術進展走向消費市場,將具身大模型GLOW的「一教就會」能力帶入真實家庭。

剛剛