Sonnet 5.5發佈,智能水平超越GPT-6 Astra,說好的減速呢?

字母AI2026.09.29 09:09 · 來自北京全文2568字00:00 / 06:48Sonnet 5.5發佈,阿莫迪嘴上說減速,腳下踩油門。文 | 字母AI口口聲聲呼籲減速的阿莫迪,一腳踩滿了油門。2026年9月26日,Anthropic發佈了Sonnet 5.5。不僅性能接近Opus 5.5,價格還只有Opus 5.5的一半。在Artificial Analysis給出的智能水平評分榜上,Sonnet5.5更是超越了GPT-6 Astra以及Anthropic自己的旗艦模型Claude Fable 5.1。關鍵在於性價比,目前,Sonnet 5.
5幾乎包圓了所有中等難度的任務,尤其是開發、科研和數學。除去那些非常簡單的任務外,沒有任何一款模型,能在性價比方面追上Sonnet 5.5。所以,說好的減速呢?為什麼它這麼強還這麼便宜?Sonnet 5.5的性能非常強。其在Terminal-Bench 4.0的成績為70.6%,上代Sonnet 5只有10.3%。在GDPval-AA v2.1上,它拿到1844分,距離Opus 5.5的1846分只差2分。CursorBench 4.0是55.5%對57.8%,同樣接近於Opus 5.5。Anthropic表示,雖然Sonnet 5.5性能和Opus 5.
5接近,但是遇到需要持續判斷、目標又不夠明確的複雜工作,Opus 5.5的效果會更好。Sonnet 5.5更適合日常任務,比如修bug、迭代功能,以及做文檔、幻燈片和表格。Sonnet是Claude家族裡的輕量模型,它的性能本應該和旗艦模型差很多才對,但為什麼Sonnet 5.5會突然變得這麼能幹?從公開材料看,最明顯的變化不是它記住了更多知識,而是它把任務做完的能力強了。Anthropic從Sonnet 5開始,就強化了推理、工具使用和編程,做事時更願意調用工具並檢查結果。到了5.5,提升集中體現在智能體編程、電腦操作和視覺理解這些需要連續行動的環節。它在OSWorld 2.
1上從上代的57.0%提升至80.1%,在不使用工具的圖表識別測試Chartography上從15.6%提升至61.6%。也就是說,Sonnet 5.5已經掌握了從屏幕裡收集信息,再據此推進任務。拿修bug來說,讀懂代碼只是第一步,模型想要完成整個修bug的任務,它還得找到相關文件、判斷改動會影響哪裡、調用工具修改,再確認問題是否解決。任何一步出錯,整道題都可能失敗。這就是為什麼Sonnet 5.5在Terminal-Bench上的得分能大幅提升,它不是那種簡單的“代碼智商”暴漲,是通過這種收集信息的能力,讓模型能完成整個鏈條。一個猜想,Sonnet 5.5可能也對Opus 5.5進行了蒸餾。
在測試過程中發現,Sonnet 5.5會說一些Opus 5.5才會出現的口頭禪,比如“You are right!”(你是對的)Anthropic在發佈Opus 5.5時,就明確說過它改進了寫作與溝通方式,“You are right!”最具代表,Fable 5.1從來不會說這個口頭禪,但是Sonnet 5.5也開始說這個口頭禪了。那它為什麼便宜?先看標價:Sonnet 5.5每百萬輸入、輸出token分別是2美元和10美元,正好是Opus 5.5的一半。5分鐘緩存寫入是2.50美元對5美元,緩存讀取都是0.20美元。
所謂5分鐘緩存寫入,指的是通過API首次發送一段會重複使用的提示內容時,讓系統把它緩存起來,這次寫入,就是按“5分鐘有緩存”檔位來計費的。同時,Anthropic還表示“每項任務最高便宜 30%”,來自完成同一件事通常消耗更少 token。用同一價格、少走一些彎路,賬單自然會變薄。還是以編程來舉例。早期測試者觀察到,Sonnet 5.5比Sonnet 5更傾向於把工具調用成批處理。這就使得整體步驟更少,進而更省token。Anthropic稱,在FrontierCode的High檔位上,它比上代同檔位高約10%,單任務成本卻約為後者的15分之1。在一些評測中,Sonnet 5.
5用Low或Medium檔位,就能以大約十分之一的任務成本超過Sonnet 5的最好成績。便宜的關鍵不只在每個token賣多少錢,還在模型為完成任務究竟花掉多少token、繞過多少次工具。此外,Sonnet 5.5的輸出速度也比Sonnet 5提高了30%以上。以下為Sonnet 5.5和Sonnet 5速度、性能對比。模型之外還有什麼?比起性能,Anthropic如今更注重工程方面的提升。比如Fable 5.1,它就引入過防止提取推理內容的Preserved Thinking。如今,這套機制也進入了Sonnet 5.5,並且向前走了一步。Anthropic為Sonnet 5.
5加上防止推理提取的安全分類器,同時把它產生的思考塊綁定到創建它的賬戶或關聯賬戶。換一個不關聯的賬戶重放,API會丟棄該思考塊,模型看不到先前的推理。不過這套防護系統,普通開發者根本不用管這套防護系統,因為它並不影響你閱讀整個思考過程,Anthropic主要想防的是那些想大規模蒸餾、反覆調用來抽取模型能力的企業。思考塊的簽名還與此前的對話綁定。如果開發者改動已經發生的系統提示、工具定義或歷史消息,再把舊思考塊塞回去,新賬戶默認可能收到400錯誤。正常追加對話通常不受影響,但那些習慣在後臺悄悄改寫歷史的智能體框架,就得重新處理會話。安全護欄也從“要不要拒絕用戶過分的請求呢?
”,變成了“我該把這個問題交給誰回答?”。Sonnet 5.5的網絡安全能力提升,因此高風險網絡安全請求可能觸發分類器,並被明顯地回退給Sonnet 5。正常找bug和修bug仍可使用Sonnet 5.5。Claude API上的服務端自動回退目前處於測試階段,需要開發者啟用。Sonnet 5.5遇到某些被安全系統攔下的請求時,不一定直接結束;如果開發者開啟了“自動回退”,系統會嘗試換成 Sonnet 5 來回答。
Related
相關文章

微軟報告:全球打工人裡每五人就有一個用 AI,南北差距還在拉大
AI資訊AI新聞資訊正文微軟報告:全球打工人裡每五人就有一個用 AI,南北差距還在拉大發佈於AI新聞資訊發佈時間 :2026年9月29號 11:06閱讀 :1分鐘微軟當地時間 21 日拋出最新一期《全球人工智能普及報告》。數據顯示,到今年第二季度,全世界勞動年齡人口中已有 18.8% 用上了人工智能,比上一季度多出約 1 個百分點,且幾乎每個經濟體的使用率都在往上走。阿聯酋、新加坡領跑,日韓追趕最快把鏡頭拉到地區層面,最捨得用 AI 的還是阿聯酋(70.1%)和新加坡(64.3%),愛爾蘭、法國、挪威也都逼近一半。增速上韓國最猛,從 37.1% 跳到 40.6%;沙特排名爬升最快,從第 30 位升到第 25 位;而日本相對自身增幅最大,由 22.5% 提到 24.7%,大約漲了一成。不過這份報告也亮出一道刺眼的裂痕:全球北方勞動年齡人口的 AI 採用率平均有 28.8%,南方卻只有 16.2%,世界層面的南北落差進一步拉大。作為對比,美國這一比例為 33.0%,排在第 21 位。換句話說,AI 的滲透仍在加速,但紅利遠未均勻攤開。相關推薦Anthropic搶在OpenAI開發者大會前甩出Claude Sonnet 5.5,一半價格逼近Opus、還通關了寶可夢Anthropic 搶在 OpenAI 年度開發者大會前發佈 Claude Sonnet5.5,定位日常工作全能助手。它打破速度、成本、質量“不可能三角”:較 Sonnet5 提速30%,單任務成本最高降30%,定價僅 Opus5.5 一半,性能幾乎追平,並在 Terminal-Bench4.0 等多項測試中反超自家高端型號;文章還以遊戲為例說明其“腦子夠用”。2026年9月29號 10:38108.7kKling4.0即將上線:支持8000Token與立體聲唇形同步9月28日,可靈AI宣佈Kling4.0將於10月全面

微軟納德拉:AI 行業“有點飄了”,呼籲迴歸用戶需求
首頁 > 智能時代>人工智能 微軟納德拉:AI 行業“有點飄了”,呼籲迴歸用戶需求 2026/9/29 11:21:09 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 9 月 29 日消息,亞歷克斯 · 希思(Alex Heath)於 9 月 27 日在 LinkedIn 平臺發佈視頻,分享了一段採訪微軟首席執行官薩蒂亞 · 納德拉(Satya Nadella)的視頻,聚焦當前行業 AI 發展現狀以及未來趨勢等。在本次採訪中,納德拉表示目前整個 AI 行業過於浮躁,刻意追求前沿概念,導致整個行業“有點飄了”。他認為當前 AI 領導者容易陷入技術細節,忽視普通用戶的真實需求。納德拉表示對於普通用戶而言,相對於各種“AI 畫餅”,更希望 AI 技術能帶來實際利益。IT之家翻譯納德拉的採訪內容如下:我認為整個 AI 行業已經“飄了”,AI 領導者更注重 AI 本身,而忽略了用戶的實際需求。我認為現實世界想知道…… 這項技術是否能為他們帶來利益,他們能否掌控它,他們能否從中獲益,擁有美好的經濟前景。我們在構建和推進 AI 技術發展的同時,必須贏得消費者和社區的信任,僅僅為了技術而慶祝技術是行不通的。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:納德拉,微軟微軟 CEO 納德拉回應 XBOX 裁員:很高興看到團隊精簡微軟 CEO 納德拉示警:企業要掌控 Token 資本,使用 AI 不能押注單一模型微軟整體業績強勁但 XBOX 業務持續萎縮,CEO 納德拉樂觀預計明年反彈納德拉官宣微軟首個 AI 安全模型 MAI-Cyber-1-Flash,跑分超 Mythos 5 和 GPT-5.5 Cyber微軟 CEO 納德拉:依賴單一 AI 滿足所有需求的公司恐將無法生存微軟 CEO 納德拉:我們不能眼睜睜看著 AI 巨頭吞噬經濟

Fireworks AI 推出 FireRouter with Opus:編碼任務成本降 57%,準確率僅損失 1.5 個百分點
AI資訊AI新聞資訊正文Fireworks AI 推出 FireRouter with Opus:編碼任務成本降 57%,準確率僅損失 1.5 個百分點發佈於AI新聞資訊發佈時間 :2026年9月29號 10:53閱讀 :1分鐘Fireworks AI 近日發佈 FireRouter with Opus,這是市場上首個緩存感知路由器,針對 Claude Opus 系列進行了優化,並首次以獨立路由模型形式作為 serverless 端點開放。經過一個多月的內部 A/B 測試,該方案執行編碼任務的準確率達到單獨使用 Opus 的98.1%,而成本降低了57%。FireRouter 的核心邏輯是在每次用戶輪次中,評估模型集合中每個模型對當前任務的適合程度,估算每個模型的處理成本(包括提示緩存成本),並權衡切換模型帶來的節省與丟失緩存是否值得,最終路由到質量與成本之間取得最佳平衡的模型。目前路由池包含 Claude Opus5.5、GLM5.3和 GLM5.3Flash,隨著新模型發佈將持續調整。測試數據來自內部編碼流量,會話被隨機分配到 FireRouter with Opus 組或僅使用 Opus 的對照組,工作負載和用戶均相同。結果顯示,每次會話成本從15.36美元降至6.63美元,降幅57%(±19個百分點,95% 置信區間)。準確率方面,FireRouter with Opus 在評分輪次中得分78.7%,而僅使用 Opus 為80.2%,差距僅1.5個百分點(±1.3),即達到 Opus 整體準確率的98.1%。緩存命中率方面,FireRouter with Opus 為94.2%,單獨使用 Opus 為97.8%,差距3.6個百分點。Fireworks AI 解釋稱,這是一個微小而有意的取捨——由於內部編碼工作中開源模型可以處理許多常規輪次,緩存感知路由通過將簡單任務

Anthropic搶在OpenAI開發者大會前甩出Claude Sonnet 5.5,一半價格逼近Opus、還通關了寶可夢
這款被定位為日常工作全能助手的新模型,把速度快、成本低、質量高這套常被說成不可能三角的標籤直接撕了下來——相比前代 Sonnet5,速度提升30%,單任務成本最高降30%,定價卻只有 Opus5.5的一半,性能卻幾乎追平,甚至在 Terminal-Bench4.

AI 寫作特徵減少:Claude Opus 5.5 破折號使用量下降約 95%、分號下降 73%
作者:故淵 責編:故淵 評論: 9 月 29 日消息,@arena 於 9 月 26 日在 X 平臺發佈推文,通過寫作指標測試,發現相比較 Opus 5 模型,Anthropic 的 Claude Opus 5.5 破折號使用量下降約 95%,每 1,000 個單詞從 15.

可靈AI發佈Kling4.0:支持8000Token與立體聲唇形同步
目前,Kling4.0Flash版本已面向黑金年卡會員開放小範圍率先體驗。本次升級在畫面真實感、創意可控性及敘事完整度三大核心維度實現了大幅躍升,為創作者帶來更專業的“全能班底”。視聽表現全面突破,直逼電影級質感Kling4.0顯著提升了應對高速運動、連續動作、跟拍及環繞等大幅度鏡頭運動時的穩定性與連貫性。