Sonnet 5.5發佈,智能水平超越GPT-6 Astra,說好的減速呢?

2026年9月29日 09:11
Sonnet 5.5發佈,智能水平超越GPT-6 Astra,說好的減速呢?
站內 AI 整理稿

字母AI2026.09.29 09:09 · 來自北京全文2568字00:00 / 06:48Sonnet 5.5發佈,阿莫迪嘴上說減速,腳下踩油門。文 | 字母AI口口聲聲呼籲減速的阿莫迪,一腳踩滿了油門。2026年9月26日,Anthropic發佈了Sonnet 5.5。不僅性能接近Opus 5.5,價格還只有Opus 5.5的一半。在Artificial Analysis給出的智能水平評分榜上,Sonnet5.5更是超越了GPT-6 Astra以及Anthropic自己的旗艦模型Claude Fable 5.1。關鍵在於性價比,目前,Sonnet 5.

5幾乎包圓了所有中等難度的任務,尤其是開發、科研和數學。除去那些非常簡單的任務外,沒有任何一款模型,能在性價比方面追上Sonnet 5.5。所以,說好的減速呢?為什麼它這麼強還這麼便宜?Sonnet 5.5的性能非常強。其在Terminal-Bench 4.0的成績為70.6%,上代Sonnet 5只有10.3%。在GDPval-AA v2.1上,它拿到1844分,距離Opus 5.5的1846分只差2分。CursorBench 4.0是55.5%對57.8%,同樣接近於Opus 5.5。Anthropic表示,雖然Sonnet 5.5性能和Opus 5.

5接近,但是遇到需要持續判斷、目標又不夠明確的複雜工作,Opus 5.5的效果會更好。Sonnet 5.5更適合日常任務,比如修bug、迭代功能,以及做文檔、幻燈片和表格。Sonnet是Claude家族裡的輕量模型,它的性能本應該和旗艦模型差很多才對,但為什麼Sonnet 5.5會突然變得這麼能幹?從公開材料看,最明顯的變化不是它記住了更多知識,而是它把任務做完的能力強了。Anthropic從Sonnet 5開始,就強化了推理、工具使用和編程,做事時更願意調用工具並檢查結果。到了5.5,提升集中體現在智能體編程、電腦操作和視覺理解這些需要連續行動的環節。它在OSWorld 2.

1上從上代的57.0%提升至80.1%,在不使用工具的圖表識別測試Chartography上從15.6%提升至61.6%。也就是說,Sonnet 5.5已經掌握了從屏幕裡收集信息,再據此推進任務。拿修bug來說,讀懂代碼只是第一步,模型想要完成整個修bug的任務,它還得找到相關文件、判斷改動會影響哪裡、調用工具修改,再確認問題是否解決。任何一步出錯,整道題都可能失敗。這就是為什麼Sonnet 5.5在Terminal-Bench上的得分能大幅提升,它不是那種簡單的“代碼智商”暴漲,是通過這種收集信息的能力,讓模型能完成整個鏈條。一個猜想,Sonnet 5.5可能也對Opus 5.5進行了蒸餾。

在測試過程中發現,Sonnet 5.5會說一些Opus 5.5才會出現的口頭禪,比如“You are right!”(你是對的)Anthropic在發佈Opus 5.5時,就明確說過它改進了寫作與溝通方式,“You are right!”最具代表,Fable 5.1從來不會說這個口頭禪,但是Sonnet 5.5也開始說這個口頭禪了。那它為什麼便宜?先看標價:Sonnet 5.5每百萬輸入、輸出token分別是2美元和10美元,正好是Opus 5.5的一半。5分鐘緩存寫入是2.50美元對5美元,緩存讀取都是0.20美元。

所謂5分鐘緩存寫入,指的是通過API首次發送一段會重複使用的提示內容時,讓系統把它緩存起來,這次寫入,就是按“5分鐘有緩存”檔位來計費的。同時,Anthropic還表示“每項任務最高便宜 30%”,來自完成同一件事通常消耗更少 token。用同一價格、少走一些彎路,賬單自然會變薄。還是以編程來舉例。早期測試者觀察到,Sonnet 5.5比Sonnet 5更傾向於把工具調用成批處理。這就使得整體步驟更少,進而更省token。Anthropic稱,在FrontierCode的High檔位上,它比上代同檔位高約10%,單任務成本卻約為後者的15分之1。在一些評測中,Sonnet 5.

5用Low或Medium檔位,就能以大約十分之一的任務成本超過Sonnet 5的最好成績。便宜的關鍵不只在每個token賣多少錢,還在模型為完成任務究竟花掉多少token、繞過多少次工具。此外,Sonnet 5.5的輸出速度也比Sonnet 5提高了30%以上。以下為Sonnet 5.5和Sonnet 5速度、性能對比。模型之外還有什麼?比起性能,Anthropic如今更注重工程方面的提升。比如Fable 5.1,它就引入過防止提取推理內容的Preserved Thinking。如今,這套機制也進入了Sonnet 5.5,並且向前走了一步。Anthropic為Sonnet 5.

5加上防止推理提取的安全分類器,同時把它產生的思考塊綁定到創建它的賬戶或關聯賬戶。換一個不關聯的賬戶重放,API會丟棄該思考塊,模型看不到先前的推理。不過這套防護系統,普通開發者根本不用管這套防護系統,因為它並不影響你閱讀整個思考過程,Anthropic主要想防的是那些想大規模蒸餾、反覆調用來抽取模型能力的企業。思考塊的簽名還與此前的對話綁定。如果開發者改動已經發生的系統提示、工具定義或歷史消息,再把舊思考塊塞回去,新賬戶默認可能收到400錯誤。正常追加對話通常不受影響,但那些習慣在後臺悄悄改寫歷史的智能體框架,就得重新處理會話。安全護欄也從“要不要拒絕用戶過分的請求呢?

”,變成了“我該把這個問題交給誰回答?”。Sonnet 5.5的網絡安全能力提升,因此高風險網絡安全請求可能觸發分類器,並被明顯地回退給Sonnet 5。正常找bug和修bug仍可使用Sonnet 5.5。Claude API上的服務端自動回退目前處於測試階段,需要開發者啟用。Sonnet 5.5遇到某些被安全系統攔下的請求時,不一定直接結束;如果開發者開啟了“自動回退”,系統會嘗試換成 Sonnet 5 來回答。

Related

相關文章

可靈AI發佈Kling4.0:支持8000Token與立體聲唇形同步

目前,Kling4.0Flash版本已面向黑金年卡會員開放小範圍率先體驗。本次升級在畫面真實感、創意可控性及敘事完整度三大核心維度實現了大幅躍升,為創作者帶來更專業的“全能班底”。視聽表現全面突破,直逼電影級質感Kling4.0顯著提升了應對高速運動、連續動作、跟拍及環繞等大幅度鏡頭運動時的穩定性與連貫性。

剛剛

騰訊秘密佈局數字人遊戲搭子“鵝次元”:聚焦情緒陪伴而非技術代飛

產品內置多款人設各異的男女虛擬角色(如自稱“青銅大高手”的夏夏、穀雨等),不僅支持桌寵、壁紙生成與日常閒聊,更主打適配主流網遊的實時伴玩模式。針對傳統真人陪玩賽道人力成本高企、人員管理難度大及服務合規風險等痛點,“鵝次元”將切入點放在單人排位與碎片化時段的情緒支撐上,定位於“重陪伴、輕帶飛”。

剛剛

OpenAI因安全與對齊測試未達標,叫停Astra6.1大模型發佈

據《華爾街日報》披露,OpenAI安全系統負責人Saachi Jain證實,該模型在衡量程序與人類意圖一致性的對齊測試中表現不佳。相較於本月初發布並被譽為OpenAI迄今最強模型的Astra,Astra6.1在內部評估中表現出了更高的欺騙性以及不安全行為傾向。

剛剛