Claude Opus 5.5突襲!68萬行代碼一天遷完,API價格打8折

在代碼、知識工作、計算機操作等多項基準測試中拿下第一的同時,輸出速度也比Opus 5快了30%以上。這暫停得好好的前沿,怎麼不到兩週又被推進了。那CEO Dario Amodei發表的“放緩前沿”公開信算什麼?算他能發。這屆模型開始拿代碼當畫筆 目前看到比較新穎的測試是用純代碼生成圖像,SVG鵜鶘騎自行車已經被刷爆了,這次是更復雜的Python渲染。類似的能力可以擴展成用純js代碼生成渲染視頻。多項跑分登頂,API價格打8折 他們說任務成本降4成,但API價格並沒有直接打6折。Opus 5.5的輸入、輸出價格分別是每百萬Token 4美元和20美元,相比Opus 5下降20%。
再加上完成同一任務需要的步驟和Token更少,Anthropic測算,典型任務的總成本可以下降40%。真正下狠手的是緩存讀取價。這一項從Opus 5的每百萬Token 0.50美元,直接降到0.20美元,砍了60%。做Agent編程的都知道,長對話和大型代碼任務需要反覆讀取上下文,緩存讀取經常佔據成本的大頭。相比賬面上的API單價,這一刀可能更有實際體感。另外還有一個Fast mode,輸出速度最高可達標準模式的2.5倍,價格也翻倍至每百萬輸入Token 8美元、輸出Token 40美元,適合對延遲特別敏感的場景。
訂閱用戶也加量了,Pro、Max、Team和按席位收費的企業版,五小時使用限額都會提高;Anthropic還提供了一次可以暫存、由用戶自行選擇時間使用的rate limit reset。具體看跑分,目前最新鮮的榜就是Terminal-Bench 4.0了,衡量模型處理複雜命令行任務的能力。Opus 5.5拿下66.4%,上一代Opus 5是52.3%,OpenAI的GPT-6 Astra是57.9%,Claude自家的Fable 5.1是55.8%。已經明顯拉開差距。在另一項編程基準FrontierCode v1.1上,Opus 5.5以54.4%超過GPT-6 Astra的53.
3%,差距就沒那麼明顯了。而且推理effort開中檔效果反而更好。Opus 5.5在默認effort,也就是中檔設置下,反而跑出了54.6%,超過表中其他模型的最高成績,也略高於自己開到最高檔時的54.4%。到了這個能力水平,0.2個百分點基本已經落在波動範圍裡。Anthropic自己也承認,跑分差距越來越難準確反映真實使用體驗,他們內部使用時,Opus 5.5和Fable 5.1的差距就沒有榜單看起來這麼大。另一項CursorBench 4.0,測的是來自真實Cursor會話的多文件模糊任務。最高effort下,Opus 5.5拿到57.8%,比Fable 5.1的51.
8%高6分,比GPT-5.6 Sol的41.7%高16.1分。如果看性價比,Opus 5.5在默認中檔設置下得分52.5%,依然領先GPT-5.6 Sol的最高成績約11分,單項任務成本只有後者的三分之一左右。Opus 5.5特別強調在大規模代碼庫級別的任務上有明顯提升。早期測試者曾用它遷移68萬行代碼,不到一天完成。換成人類工程團隊,預計至少需要數週。還有一位測試者用它審計並修復一個20萬行代碼庫,耗時不到3小時。同樣的任務,Opus 5花了超過20小時,使用的Token數量還是它的2.5倍。在一項內部測試中,Anthropic讓Opus 5.5和Fable 5.
1分別將HAProxy從C語言重寫成Rust。HAProxy是一款被廣泛使用的Web流量負載均衡軟件。兩個版本都通過了HAProxy自身幾乎全部迴歸測試,但Opus 5.5只用了9.5小時,Fable 5.1用了12小時,前者的成本低了51%。Anthropic還讓模型優化一個Web應用所有頁面的加載速度。Opus 5.5在40次測試中成功了39次;Opus 5雖然也縮短了加載時間,但改進幅度更小,還改變了應用原本的行為。知識工作方面同樣值得關注。在覆蓋44個職業的真實工作能力評估GDPval-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.
1是1735,Opus 5是1708。在默認effort設置下,Opus 5.5的得分就超過了GPT-6 Astra在最高effort下的表現,單項任務成本大約只有後者的五分之一。投資公司Walleye Capital反饋,Opus 5.5在最低設置下,就基本完成了他們的量化研究評測任務。把effort調高後,它還發現評測指令裡的分鐘索引存在一個off-by-one錯誤,並主動修正。模型甚至特意備註:這樣處理是正確的,但可能會導致自己被評分器扣分。Walleye稱,此前測試過的所有模型,都沒有發現並處理這個問題。還有個明顯變化在於:Opus 5.5說話的方式變了。
以前Opus 5雖然也能找到答案,但很快就會鑽進代碼塊、時間線和區間定義裡,用戶需要自己從大量技術細節中提煉結論。Opus 5.5會先把最重要的信息擺出來,再解釋原因。官網展示了一個billing系統Bug的對比。Opus 5找到問題後,馬上開始解釋代碼改動和時間區間;Opus 5.5開頭就把賬算清楚了: 額外減少的9.92美元來自一個Bug,免費層調整隻佔1.50美元。隨後它才說明,究竟是哪次代碼重構把每個月最後一天的大部分用量漏掉了。一位早期測試者的評價是: It writes the way I do(它寫東西的方式跟我一樣)。Anthropic還特意強調,表達清楚不只是文風升級。
模型把關鍵信息放在前面、減少術語和特異性表達,人類檢查其結論和操作過程也會更加容易,這本身就是一項安全收益。和Fable一個級別的籠子 能力往前衝,安全籠子也跟著加厚了。Opus 5.5是首款同時搭載Fable 5.1同級網絡安全、生物安全和反蒸餾護欄的Opus模型。觸發相關限制後,系統會透明地回退到其他模型處理。發佈之前,它還接受了METR和Frontier Design兩家外部機構的評估。這也是Anthropic對“放緩前沿”的解釋:模型照常研發和發佈,但要給安全對齊和外部審查留出時間。在Anthropic內部覆蓋近2000個模擬場景的自動化行為審計中,Opus 5.
5在幾乎所有失調行為指標上,都拿到了近期Claude模型中的最好成績。在一項專門測試模型越過安全邊界傾向的新評估中,Opus 5.5嘗試規避邊界的頻率,比Opus 5和Claude Mythos 5.1低了約85%。僅有的幾次嘗試也都屬於低嚴重性事件,而且由模型自行上報。不過Anthropic同時承認,他們觀察到Opus 5.5經常懷疑自己正在接受評估。一旦模型知道“這是一場考試”,測試中的表現能否代表真實部署環境,就要打上一個問號。Anthropic稱,目前仍然沒有辦法在發佈前可靠地發現所有潛在問題。在更實際的Agent防護上,Opus 5.5還配備了三層措施。
它會在執行前檢查每一個操作;運行環境放在安全團隊可以審計的開源沙箱中;代碼審查功能則會在代碼合併前檢查漏洞。面對提示注入攻擊,Opus 5.5在Anthropic測試的編程、工具調用、計算機操作和網頁瀏覽等場景中,都追平或超過了Opus 5。這麼厚的籠子,也和它在高風險領域的能力有關。在生物學領域,Opus 5.5已經在多個方向追平甚至超過Claude Mythos 5.1,因此使用了與Fable 5.1相同的生物安全護欄。在與Dyno Therapeutics合作開展的長期分子預測和設計評估中,Opus 5.5取得了進一步提升。參與紅隊測試的專家認為,其科學新穎性與他們測試過的最強模型相當。
經過審核的學術實驗室、初創公司和製藥企業,可以通過新推出的Life Sciences Verification Program,申請適用於生物研發工作的更寬鬆權限。網絡安全也是一樣。由於Opus 5.5的網絡安全能力很強,普通用戶提交的大多數網絡安全任務會被自動轉交給Opus 4.8。經過認證的網絡安全從業者,則可以通過即將擴展的Cyber Verification Program申請使用Opus 5.5。反蒸餾措施也直接上到了Fable 5.1的級別。Opus 5.
5搭載了preserved thinking機制,限制API用戶編輯Claude此前生成的思考上下文,防止攻擊者藉此批量提取模型的推理能力。這項限制適用於2026年8月31日及以後創建的API賬戶。與此同時,Opus 5.5不再允許關閉thinking模式,輸出文本中也加入了水印。這種水印不會直接顯示在文本里,也沒有添加隱藏字符。它通過調整模型在多個意思相近的詞語之間如何選擇,留下可供專用檢測工具識別的統計模式,普通讀者看不出區別。OMT:Haiku終於更新了 在Sonnet、Opus和Fable都已經進入5系列之後,Claude家的“小杯”還停留在Haiku 4.5。這次終於有準信了。
Anthropic宣佈,Sonnet 5.5和Haiku 5.5都將在未來幾周內推出,同樣會獲得性能、效率和安全方面的升級。也就是說,Opus 5.5只是5.5系列的第一款。OpenAI這邊剛剛一口氣端出GPT-6 Astra和GPT-5.6 Sol,Anthropic那邊緊接著發佈Opus 5.5,還預告後面有兩款新模型排隊。前沿確實沒有停,大家都在忙著踩油門啊~ 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

Jev vs Decitron:同為決策AI,為什麼不是一回事?
它來自TypeSafe AI。這支有OpenAI背景的團隊沒有繼續卷生成和推理,而是換了個方向:讓AI直接做判斷。他們甚至把口號直接寫成:Decisions, not strings(要決策,不要文本)。Jev的走紅,也讓“Decision”(決策)重新成為AI圈的熱門詞。

高通發佈驍龍 8 Elite Gen 6 與 Extreme 芯片,支持本地運行 300 億參數大模型
這兩款新芯片將 AI 賦能作為核心發力點,旨在為移動終端提供更強大的端側智能算力,進一步推動 AI 代理(AI Agents)在手機端的深度個性化應用。在核心架構與本地大模型支持方面,這兩款芯片配備了全新的傳感中樞(sensing hub),能夠支持運行高達2.

實時世界模型進入“全科生”階段,PixVerse R2先交卷!
愛詩科技推出全新實時世界模型PixVerse R2,號稱解決了實時生成與通用能力難以兼顧的業界難題。R2基於統一可擴展框架,整合文字、圖像、聲音與動作,實現場景持續演化與音畫同步控制,上線後即登上X平台熱度榜。

Win11 驚現 AI 惡意軟件 ClosedQuorum:入侵後自主決策,專挖最有價值信息
該惡意軟件主要針對 Windows 11 平臺,會在成功入侵用戶電腦後調用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等 AI 模型自主決策,專門挖掘攻擊目標最有價值的信息。調用 Gemini、DeepSeek 等模型,入侵後自主決策Talos 深入分析後發現,ClosedQuorum 在成功入侵目標設備後,會藉助多個 AI 模型來決策攻擊方案,包括竊取瀏覽器登錄憑證、提取加密貨幣信息、持久化執行惡意軟件,以及向其他設備橫向散播惡意軟件。

阿里千問AI平臺全面升級模型服務、Agent服務、AI應用
阿里巴巴宣布千問AI平台全面升級,以推動Agent進入生產為核心,新增Agent服務與行業AI解決方案,並推出API優速模式、Agent Studio、千問AI座艙等能力。平台強調從消耗Token轉向交付結果,並預計至2032年算力規模將超過20GW,以支撐完整AI體系。Agent Studio提供企業級全棧服務,支援模型路由、託管運行與生態工具接入,同時強化模型服務的效能與成本優化。

GPT-6 Astra搓3D刷屏後,3D生成的競爭規則變了
GPT-6 Astra的出現讓3D生成行業競爭標準從「Production-Ready」轉向「Agent-Ready」,強調生成能力需能被AI Agent理解和調用。影眸Hyper3D推出Agentic Mode,能自主分析雜亂輸入、規劃建模路徑,並支援後續參數化調整、材質替換與動畫預設,同時開放MCP接口讓外部Agent串接3D生成流程。