Claude Opus 5.5突襲!68萬行代碼一天遷完,API價格打8折

2026年9月23日 13:04
Claude Opus 5.5突襲!68萬行代碼一天遷完,API價格打8折
站內 AI 整理稿

在代碼、知識工作、計算機操作等多項基準測試中拿下第一的同時,輸出速度也比Opus 5快了30%以上。這暫停得好好的前沿,怎麼不到兩週又被推進了。那CEO Dario Amodei發表的“放緩前沿”公開信算什麼?算他能發。這屆模型開始拿代碼當畫筆 目前看到比較新穎的測試是用純代碼生成圖像,SVG鵜鶘騎自行車已經被刷爆了,這次是更復雜的Python渲染。類似的能力可以擴展成用純js代碼生成渲染視頻。多項跑分登頂,API價格打8折 他們說任務成本降4成,但API價格並沒有直接打6折。Opus 5.5的輸入、輸出價格分別是每百萬Token 4美元和20美元,相比Opus 5下降20%。

再加上完成同一任務需要的步驟和Token更少,Anthropic測算,典型任務的總成本可以下降40%。真正下狠手的是緩存讀取價。這一項從Opus 5的每百萬Token 0.50美元,直接降到0.20美元,砍了60%。做Agent編程的都知道,長對話和大型代碼任務需要反覆讀取上下文,緩存讀取經常佔據成本的大頭。相比賬面上的API單價,這一刀可能更有實際體感。另外還有一個Fast mode,輸出速度最高可達標準模式的2.5倍,價格也翻倍至每百萬輸入Token 8美元、輸出Token 40美元,適合對延遲特別敏感的場景。

訂閱用戶也加量了,Pro、Max、Team和按席位收費的企業版,五小時使用限額都會提高;Anthropic還提供了一次可以暫存、由用戶自行選擇時間使用的rate limit reset。具體看跑分,目前最新鮮的榜就是Terminal-Bench 4.0了,衡量模型處理複雜命令行任務的能力。Opus 5.5拿下66.4%,上一代Opus 5是52.3%,OpenAI的GPT-6 Astra是57.9%,Claude自家的Fable 5.1是55.8%。已經明顯拉開差距。在另一項編程基準FrontierCode v1.1上,Opus 5.5以54.4%超過GPT-6 Astra的53.

3%,差距就沒那麼明顯了。而且推理effort開中檔效果反而更好。Opus 5.5在默認effort,也就是中檔設置下,反而跑出了54.6%,超過表中其他模型的最高成績,也略高於自己開到最高檔時的54.4%。到了這個能力水平,0.2個百分點基本已經落在波動範圍裡。Anthropic自己也承認,跑分差距越來越難準確反映真實使用體驗,他們內部使用時,Opus 5.5和Fable 5.1的差距就沒有榜單看起來這麼大。另一項CursorBench 4.0,測的是來自真實Cursor會話的多文件模糊任務。最高effort下,Opus 5.5拿到57.8%,比Fable 5.1的51.

8%高6分,比GPT-5.6 Sol的41.7%高16.1分。如果看性價比,Opus 5.5在默認中檔設置下得分52.5%,依然領先GPT-5.6 Sol的最高成績約11分,單項任務成本只有後者的三分之一左右。Opus 5.5特別強調在大規模代碼庫級別的任務上有明顯提升。早期測試者曾用它遷移68萬行代碼,不到一天完成。換成人類工程團隊,預計至少需要數週。還有一位測試者用它審計並修復一個20萬行代碼庫,耗時不到3小時。同樣的任務,Opus 5花了超過20小時,使用的Token數量還是它的2.5倍。在一項內部測試中,Anthropic讓Opus 5.5和Fable 5.

1分別將HAProxy從C語言重寫成Rust。HAProxy是一款被廣泛使用的Web流量負載均衡軟件。兩個版本都通過了HAProxy自身幾乎全部迴歸測試,但Opus 5.5只用了9.5小時,Fable 5.1用了12小時,前者的成本低了51%。Anthropic還讓模型優化一個Web應用所有頁面的加載速度。Opus 5.5在40次測試中成功了39次;Opus 5雖然也縮短了加載時間,但改進幅度更小,還改變了應用原本的行為。知識工作方面同樣值得關注。在覆蓋44個職業的真實工作能力評估GDPval-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.

1是1735,Opus 5是1708。在默認effort設置下,Opus 5.5的得分就超過了GPT-6 Astra在最高effort下的表現,單項任務成本大約只有後者的五分之一。投資公司Walleye Capital反饋,Opus 5.5在最低設置下,就基本完成了他們的量化研究評測任務。把effort調高後,它還發現評測指令裡的分鐘索引存在一個off-by-one錯誤,並主動修正。模型甚至特意備註:這樣處理是正確的,但可能會導致自己被評分器扣分。Walleye稱,此前測試過的所有模型,都沒有發現並處理這個問題。還有個明顯變化在於:Opus 5.5說話的方式變了。

以前Opus 5雖然也能找到答案,但很快就會鑽進代碼塊、時間線和區間定義裡,用戶需要自己從大量技術細節中提煉結論。Opus 5.5會先把最重要的信息擺出來,再解釋原因。官網展示了一個billing系統Bug的對比。Opus 5找到問題後,馬上開始解釋代碼改動和時間區間;Opus 5.5開頭就把賬算清楚了: 額外減少的9.92美元來自一個Bug,免費層調整隻佔1.50美元。隨後它才說明,究竟是哪次代碼重構把每個月最後一天的大部分用量漏掉了。一位早期測試者的評價是: It writes the way I do(它寫東西的方式跟我一樣)。Anthropic還特意強調,表達清楚不只是文風升級。

模型把關鍵信息放在前面、減少術語和特異性表達,人類檢查其結論和操作過程也會更加容易,這本身就是一項安全收益。和Fable一個級別的籠子 能力往前衝,安全籠子也跟著加厚了。Opus 5.5是首款同時搭載Fable 5.1同級網絡安全、生物安全和反蒸餾護欄的Opus模型。觸發相關限制後,系統會透明地回退到其他模型處理。發佈之前,它還接受了METR和Frontier Design兩家外部機構的評估。這也是Anthropic對“放緩前沿”的解釋:模型照常研發和發佈,但要給安全對齊和外部審查留出時間。在Anthropic內部覆蓋近2000個模擬場景的自動化行為審計中,Opus 5.

5在幾乎所有失調行為指標上,都拿到了近期Claude模型中的最好成績。在一項專門測試模型越過安全邊界傾向的新評估中,Opus 5.5嘗試規避邊界的頻率,比Opus 5和Claude Mythos 5.1低了約85%。僅有的幾次嘗試也都屬於低嚴重性事件,而且由模型自行上報。不過Anthropic同時承認,他們觀察到Opus 5.5經常懷疑自己正在接受評估。一旦模型知道“這是一場考試”,測試中的表現能否代表真實部署環境,就要打上一個問號。Anthropic稱,目前仍然沒有辦法在發佈前可靠地發現所有潛在問題。在更實際的Agent防護上,Opus 5.5還配備了三層措施。

它會在執行前檢查每一個操作;運行環境放在安全團隊可以審計的開源沙箱中;代碼審查功能則會在代碼合併前檢查漏洞。面對提示注入攻擊,Opus 5.5在Anthropic測試的編程、工具調用、計算機操作和網頁瀏覽等場景中,都追平或超過了Opus 5。這麼厚的籠子,也和它在高風險領域的能力有關。在生物學領域,Opus 5.5已經在多個方向追平甚至超過Claude Mythos 5.1,因此使用了與Fable 5.1相同的生物安全護欄。在與Dyno Therapeutics合作開展的長期分子預測和設計評估中,Opus 5.5取得了進一步提升。參與紅隊測試的專家認為,其科學新穎性與他們測試過的最強模型相當。

經過審核的學術實驗室、初創公司和製藥企業,可以通過新推出的Life Sciences Verification Program,申請適用於生物研發工作的更寬鬆權限。網絡安全也是一樣。由於Opus 5.5的網絡安全能力很強,普通用戶提交的大多數網絡安全任務會被自動轉交給Opus 4.8。經過認證的網絡安全從業者,則可以通過即將擴展的Cyber Verification Program申請使用Opus 5.5。反蒸餾措施也直接上到了Fable 5.1的級別。Opus 5.

5搭載了preserved thinking機制,限制API用戶編輯Claude此前生成的思考上下文,防止攻擊者藉此批量提取模型的推理能力。這項限制適用於2026年8月31日及以後創建的API賬戶。與此同時,Opus 5.5不再允許關閉thinking模式,輸出文本中也加入了水印。這種水印不會直接顯示在文本里,也沒有添加隱藏字符。它通過調整模型在多個意思相近的詞語之間如何選擇,留下可供專用檢測工具識別的統計模式,普通讀者看不出區別。OMT:Haiku終於更新了 在Sonnet、Opus和Fable都已經進入5系列之後,Claude家的“小杯”還停留在Haiku 4.5。這次終於有準信了。

Anthropic宣佈,Sonnet 5.5和Haiku 5.5都將在未來幾周內推出,同樣會獲得性能、效率和安全方面的升級。也就是說,Opus 5.5只是5.5系列的第一款。OpenAI這邊剛剛一口氣端出GPT-6 Astra和GPT-5.6 Sol,Anthropic那邊緊接著發佈Opus 5.5,還預告後面有兩款新模型排隊。前沿確實沒有停,大家都在忙著踩油門啊~ 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

Win11 驚現 AI 惡意軟件 ClosedQuorum:入侵後自主決策,專挖最有價值信息

該惡意軟件主要針對 Windows 11 平臺,會在成功入侵用戶電腦後調用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等 AI 模型自主決策,專門挖掘攻擊目標最有價值的信息。調用 Gemini、DeepSeek 等模型,入侵後自主決策Talos 深入分析後發現,ClosedQuorum 在成功入侵目標設備後,會藉助多個 AI 模型來決策攻擊方案,包括竊取瀏覽器登錄憑證、提取加密貨幣信息、持久化執行惡意軟件,以及向其他設備橫向散播惡意軟件。

剛剛
量子位生成式AI

阿里千問AI平臺全面升級模型服務、Agent服務、AI應用

阿里巴巴宣布千問AI平台全面升級,以推動Agent進入生產為核心,新增Agent服務與行業AI解決方案,並推出API優速模式、Agent Studio、千問AI座艙等能力。平台強調從消耗Token轉向交付結果,並預計至2032年算力規模將超過20GW,以支撐完整AI體系。Agent Studio提供企業級全棧服務,支援模型路由、託管運行與生態工具接入,同時強化模型服務的效能與成本優化。

剛剛
量子位生成式AI

GPT-6 Astra搓3D刷屏後,3D生成的競爭規則變了

GPT-6 Astra的出現讓3D生成行業競爭標準從「Production-Ready」轉向「Agent-Ready」,強調生成能力需能被AI Agent理解和調用。影眸Hyper3D推出Agentic Mode,能自主分析雜亂輸入、規劃建模路徑,並支援後續參數化調整、材質替換與動畫預設,同時開放MCP接口讓外部Agent串接3D生成流程。

剛剛
智東西生成式AI

華為大模型雙子星聯手造物理基模,剛融資數億元

機器人前瞻(公眾號:robot_pro) 作者 | 許麗思 編輯 | 漠影 9月23日報道,近日,物理AI公司息壤開物(XIRRA)已在兩個月內連續完成數億元種子輪及天使輪融資,由敦鴻資產領投,華控基金、三花控股、銀杏谷資本、澤然資本、本堅基金、上海天使會、標樸投資等知名機構跟投。

剛剛
鈦媒體生成式AI

豆包做手機、阿里造平板:AI開始爭奪硬件控制權

識礁Farsight2026.09.23 11:43 · 來自北京全文3182字00:00 / 09:20大廠為何突然集體“變硬”?文 | 識礁Farsight繼豆包推出“第二代豆包手機”後,阿里也開始“變硬”。2026年9月22日,阿里召開2026雲棲大會,展示了仍在研發中的“千問平板”QwenBook。據《晚點LatePost》報道,QwenBook由阿里雲旗下無影團隊打造,定位原生智能體電腦,產品定義和硬件部分由團隊自研。無影過去做雲電腦積累的系統和端雲能力,將融入其中。

剛剛