Anthropic深夜放大招:Claude Opus 5.5上線,任務成本大降40%

2026年9月23日 09:23
Anthropic深夜放大招:Claude Opus 5.5上線,任務成本大降40%
站內 AI 整理稿

(公眾號:zhidxcom) 編譯 | 楊京麗 編輯 | 李水青 9月23日消息,今天凌晨,Anthropic發佈Claude Opus 5.5,這是Claude 5.5系列的首款模型。Anthropic稱,新模型在多數任務上的表現與Claude Fable 5.1相當,默認設置下的典型任務成本較上一代Opus 5降低40%,輸出速度提升超過30%。在官方公佈的9項測試中,Opus 5.5有7項成績領先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.

5在三項編程測試中均取得最高分,但在業務流程和科研Agent測試中仍落後於GPT-6 Astra。在第三方評測機構Artificial Analysis的Intelligence榜單上,Claude Opus 5.5以58分位列第一,領先Claude Fable 5.1和GPT-6 Astra的53分。具體任務中,Anthropic披露,Opus 5.5用9.5小時完成了將負載均衡軟件HAProxy從C語言改寫為Rust的任務,成本比Fable 5.1低51%;在要求逐一核對數字和引語的財報研究測試中,其生成的18份報告有16份達標,Fable 5.1和Opus 5則均未通過。

此外,一名早期測試者使用Opus 5.5,不到一天完成了涉及68萬行代碼的遷移。價格方面,Opus 5.5每百萬輸入、輸出Token分別收費4美元(約合人民幣26.8元)和20美元(約合人民幣134元),較Opus 5下調20%;緩存讀取價格較Opus 5下降60%。與此同時,Anthropic提高了多個付費套餐的五小時使用額度,並向訂閱用戶提供一次可自行選擇使用時間的額度重置機會。Opus 5.5已上線Claude及亞馬遜雲科技、谷歌雲、微軟Azure等平臺。不過,部分專業任務仍受安全機制限制,例如大多數網絡安全任務會被轉交Opus 4.8處理。Claude Sonnet 5.

5和Claude Haiku 5.5計劃在未來幾周推出。Claude Opus 5.5發佈近2個小時後,OpenAI也推出了GPT-6 Sol和GPT-6 Luna,GPT-6“宇宙”加入新成員。一、編程成績超過Fable 5.1、GPT-6 Astra,輸入輸出價格下調20% Anthropic公佈了Opus 5.5與4款模型在9項測試中的成績,對比對象包括Fable 5.1、Opus 5,以及OpenAI的GPT-6 Astra和GPT-5.6 Sol。9項測試中,Opus 5.5有7項得分最高。智能體編程方面,Opus 5.5在Terminal-Bench 4.

0、FrontierCode v1.1和CursorBench 4.0上分別得到66.4%、54.4%和57.8%,三項都是對比模型中最高。在業務流程測試AutomationBench和科研Agent測試Terminal-Bench-Science 0.1中,其成績低於GPT-6 Astra。價格方面,Opus 5.5每百萬輸入Token收費4美元(約合人民幣26.8元),每百萬輸出Token收費20美元(約合人民幣134元),均較Opus 5下降20%。Claude Code和Claude Platform還提供Opus 5.5快速模式,Anthropic稱其速度最高可達普通模式的2.5倍。

該模式每百萬輸入、輸出Token分別收費8美元(約合人民幣53.6元)和40美元(約合人民幣268元)。二、9.5小時完成代碼改寫,財報測試18份報告中16份達標 編程方面,Anthropic重點展示了代碼遷移、代碼庫審查和性能優化等長時間任務。Anthropic稱,一名早期測試者使用Opus 5.5,在不到一天內完成了涉及68萬行代碼的遷移。另一名測試者對一個20萬行代碼庫進行審查和修復,Opus 5.5用時不到3小時;Opus 5完成該任務則超過20小時,消耗的Token是前者的2.5倍。在內部測試中,Anthropic要求Opus 5.5和Fable 5.

1將負載均衡軟件HAProxy從C語言改寫為Rust。兩者改寫後的版本均通過了HAProxy自身幾乎全部迴歸測試。Opus 5.5用時9.5小時,Fable 5.1用時12小時,前者成本低51%。另一項網頁性能優化測試要求模型降低一個Web應用所有頁面的加載時間。Opus 5.5在40次測試中成功39次。Anthropic稱,Opus 5的優化幅度較小,且改變了應用原有行為。Anthropic還比較了不同推理強度下的任務成本。Anthropic稱,在默認推理強度下,Opus 5.

5在FrontierCode上的成績超過GPT-6 Astra,單次任務成本約為後者的20%;在Terminal-Bench 4.0上達到相近成績時,成本約為後者的40%。這些比例對應特定測試設置,不能直接等同於所有實際開發任務的費用差異。知識工作方面,Opus 5.5在覆蓋44種職業任務的GDPval-AA v2.1中取得1846分,高於Fable 5.1的1735分和Opus 5的1708分。Anthropic還設計了一項財報研究測試:模型只能在一個財報公告較難找到的網頁副本環境中檢索資料,並據此撰寫公司季度業績報告。自動評分程序會逐一核對報告中的數字和引語,任何編造都會導致不達標。

在不同推理強度下,Opus 5.5生成的18份報告中有16份通過質量門檻,Fable 5.1和Opus 5則未有報告通過。另一項測試中,Anthropic要求模型分析兩家虛構人力資源軟件公司的併購交易,先用Excel建立財務模型,再生成面向管理層的演示文稿。Opus 5.5與Opus 5得出了相同的交易判斷,但前者用時63分鐘,後者用時93分鐘,前者成本低50%。Anthropic認為,Opus 5.5的財務模型更完整,演示文稿更易讀,Opus 5的結果則存在少量錯誤。三、回答更簡潔,越界嘗試降低85% 除了任務執行能力,Anthropic還調整了Opus 5.

5的寫作與溝通方式,包括優先呈現關鍵信息、減少術語和不常見表達,以及更好地遵循用戶指定的寫作規則。在官方展示案例中,兩個模型被要求解釋同一個問題,某客戶8月的賬單金額為什麼出現了額外的下降。Opus 5.5在第一句話中能夠直接給出結論,“計費系統重構導致月末賬單出現漏計”,再解釋代碼邊界條件如何產生錯誤。從篇幅來看,Opus 5.5的回答也更簡潔。安全方面,Anthropic稱,Opus 5.5發佈前接受了METR、Frontier Design等外部機構評估。在覆蓋近2000個模擬場景的自動化行為審計中,其在幾乎所有受測的不對齊行為指標上優於近期Claude模型。

在一項測試模型是否試圖突破隔離邊界的新評估中,Opus 5.5嘗試繞過邊界的頻率,較Opus 5或Claude Mythos 5.1降低約85%。按照官方描述,Opus 5.5出現的相關嘗試均被評為低嚴重程度,且模型自行報告了這些行為。提示詞注入方面,Anthropic稱,Opus 5.5在編程、工具調用、計算機操作和網頁瀏覽等受測場景中的防禦表現不弱於Opus 5。在AI安全公司Gray Swan開展的一項測試中,Opus 5.5與Fable 5.1並列取得受測模型中最低的提示詞注入攻擊成功率。不過,Anthropic同時承認,部署前評估仍無法可靠發現所有失效情況。測試中,Opus 5.

5經常疑似意識到自己正接受評估,這會增加判斷其真實部署行為的難度。針對後續模型,Anthropic計劃加強強化學習訓練環境篩選、調整對齊獎勵、增加安全訓練場景,並改進基於可解釋性的監控和評估,減少對模型所寫思維鏈的依賴。這些屬於後續安全工作方向,並非已經驗證有效的結果。四、部分安全任務轉交舊模型,訂閱額度同步提高 Opus 5.5此次上線附帶了與Fable 5.1類似的網絡安全、生物學和反蒸餾防護機制。觸發相關限制時,請求會轉交其他模型處理。網絡安全方面,用戶仍可在日常軟件開發中查找和修復代碼漏洞,但大多數網絡安全任務會被轉交Opus 4.8。

Anthropic計劃在未來幾周擴大網絡安全驗證計劃,將Opus 5.5納入其中,並設置三個不同權限等級,部分等級可使用Claude Mythos模型。生物研究方面,Anthropic稱,Opus 5.5在多個任務上的能力達到或超過Claude Mythos 5.1,因此採用了與Fable 5.1相同的生物學防護措施。受相關限制影響的學術實驗室、初創公司和藥企,可申請生命科學驗證計劃,經審核後獲得適用於更廣泛生物研究工作的訪問權限。反蒸餾方面,Opus 5.5啟用了“保留思考”(preserved thinking)機制,限制API用戶通過修改Claude此前上下文來提取模型推理。

該機制適用於2026年8月31日及之後創建的API賬戶,覆蓋Fable 5.1和Opus 5.5。數據處理方面,Opus 5.5繼續提供零數據保留選項,並加入Anthropic所稱用於滿足歐盟《人工智能法案》要求的水印措施。同時,該模型不再提供關閉思考模式的選項。Opus 5.5已上線Claude及亞馬遜雲科技、谷歌雲、微軟Azure等平臺,開發者可通過模型標識claude-opus-5-5調用。訂閱方面,Anthropic提高了Pro、Max、Team及按席位計費的Enterprise套餐的五小時使用額度。訂閱用戶還將獲得一次使用限額重置機會,可保留至需要時使用。

結語:長任務的效率與成本成為升級重點 Opus 5.5此次更新的主要變化,是在提高部分編程和知識工作測試成績的同時,也著重降低了完成任務所需的時間和費用。對於需要持續運行的Agent,這些變化直接關係到實際使用成本。不過,官方測試中的優勢能否延續到真實業務中,還取決於任務複雜度、結果準確性,以及安全限制對任務執行的影響。來源:Claude

Related

相關文章

​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰

AI資訊AI新聞資訊正文​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰發佈於AI新聞資訊發佈時間 :2026年9月23號 9:52閱讀 :1分鐘人工智能技術的快速發展正在從單純的產業競爭,加速上升至全球安全與地緣政治的核心議題。據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。與此同時,包括阿里巴巴支持的月之暗面等其他中國人工智能企業也正逐步走向國際舞臺,共同參與探討如何在全球範圍內應對通用人工智能帶來的長遠挑戰。隨著各大 AI 實驗室的技術迭代不斷刷新邊界,如何平衡技術創新與安全紅線已成為全球多邊治理機制的當務之急。此次 DeepSeek 赴聯合國安理會分享其對 AI 風險的研判與實踐,不僅為國際社會提供了來自中國科技企業的技術觀察視角,也標誌著全球 AI 治理正在加速向多邊協作與深度對話的全新階段邁進。相關推薦世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管世衛組織2026年9月21日發佈《人工智能相關健康研究:倫理審查與監管》報告,指出AI正加速健康研究和醫療進步,但若缺乏倫理防線與監管,可能帶來新風險,危及人權、社會公平和公眾信任。報告對現有倫理審查機制發出警告,強調需加強倫理審查與監管。2026年9月23號 9:4652.5kGrok Bot 上線僅一個月,周活躍用戶數正式突破 40 萬大關馬斯克旗下SpaceX AI團隊推出的Grok Bot智能體上線約一個月,周活躍用戶已突破40萬。截至9月14日達41.8萬人,環比增長24%,顯示其市場熱度與

剛剛
雷峰網生成式AI

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026 本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻! 只靠語言和 token,AI 永遠跨不過物理世界這道門檻! 作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。但這條路線撞上了天花板:預訓練的邊際收益肉眼可見地遞減;模型一旦部署到真實世界,漏洞百出。2026 年,“世界模型”接棒 Scaling Law,成了牌桌上最擁擠的籌碼。然而,這個詞本身,同時被四條技術路線認領,而它們對“理解世界”這件事,幾乎各說各話。第一條賭湧現:Sora、Genie 這類視頻生成路線相信,只要下一幀逼得夠真,物理規律就會自己從像素裡長出來。第二條賭幾何:李飛飛聯合創立的 World Labs,從底層表徵就鎖死三維一致性,直接生成可自由探索的虛擬世界。第三條賭仿真:英偉達 Cosmos、Omniverse,把顯式物理引擎當作機器人的練兵場。第四條路最孤峭,也最反常識:2018 年圖靈獎得主、深度學習三位“教父”之一 Yann LeCun,押注 JEPA(聯合嵌入預測架構),它不生成未來,只在抽象表徵的空間裡預測未來。四條路的根本分歧,本質上在於一個問題:機器要“懂”物理世界,究竟該去復刻它,還是去推理它?前三條都在不同程度上試圖讓機器“看見並重建”世界;JEPA 卻選擇另一條路——編碼器先丟掉那些根本不可預測的細節,只保留可預測、可規劃的結構,然後在抽象表徵空間裡預測未來。在 LeCun 眼裡,連“預測像素”這件事本身都是偽命題:你把攝像頭對準房間一角開始錄像,下一幀會拍到什麼,取決於鏡頭外有沒

剛剛
雷峰網生成式AI

樂享以太大模型,讓中國具身智能坐上定義席

樂享以太大模型,讓中國具身智能坐上定義席 本文作者: 叢末 2026-09-23 09:46 導語: 從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。 從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。 作者丨幸麗娟 編輯丨董子博 具身智能行業一直在等一個 ChatGPT 時刻。但這個時刻,未必長得像 ChatGPT。決定這個時刻的,不是機器人會聊天,也不是機器人學會了幾個動作,而是在不確定環境裡,機器人能不能自主思考、判斷和執行,在無序的事件中,持續完成任務。過去兩年,行業積累的幾乎全是“能力上限”的展示:選好場景、選好時機、反覆調試,再拍出一條完美的Demo。上限可以“被編輯”出來展示。真實效果如何,卻少有人敢公開測。但機器人真正進入現實世界,考驗的不只是最好時能做到什麼,更是環境不斷變化時,它還能不能把事情做下去。9 月 16 日傍晚。上海閔行一家燒烤店門口,樂享科技讓兩臺機器人擺起了燒烤攤。接下來近一個小時,它們要接單、烤串、上菜。這場直播的規則,測的正是機器人在這種真實環境裡的應變能力。沒有剪輯,沒有遙控,沒有預設腳本。更絕的是,觀眾可以實時幹預:隨機出題,自由改造場地佈局,隨手改道具擺放位置,臨時打斷正在進行的任務並追加需求。現場 3 桌、6 名顧客的主線任務,就是“幹擾”,看機器人能不能像人一樣自己“圓場子”。而就在不久前,這家公司剛剛站在了一場輿論風暴的中心。故事線是這樣的:7 月,樂享上線以太大模型官網並公開完整技術路線;8月26日,一段機器人協作收拾房間的10分鐘一鏡到底 Demo,在具身圈傳開。9 月 3 日,OpenAI 上線 GPT-6 Astra 官網;三天後,首席科學家 Jakub Pachocki 發表萬字長文《異星心智》。9 月 10 日,樂享創始人郭人傑發文,三問 OpenAI:技術理

剛剛

OpenAI 重磅發佈 GPT-6 Sol 與 Luna 模型:API 價格腰斬,性能直逼頂級旗艦

AI資訊AI新聞資訊正文OpenAI 重磅發佈 GPT-6 Sol 與 Luna 模型:API 價格腰斬,性能直逼頂級旗艦發佈於AI新聞資訊發佈時間 :2026年9月23號 9:26閱讀 :1分鐘OpenAI 今日正式發佈了 GPT-6系列的最新成員 ——GPT-6Sol 與 GPT-6Luna。這兩款新模型採用了與 GPT-6Astra 類似的方法進行訓練,旨在將 Astra 在專業工作、事實性、編程、計算機使用及對齊等方面的頂尖性能,帶入速度更快、更經濟的小尺寸模型中。官方表示,雖然 GPT-6Astra 依然是追求最佳效果和無妥協體驗的首選,但 Sol 與 Luna 在大幅降低成本的同時,展現出了極其強悍的綜合競爭力。在價格方面,GPT-6Sol 和 Luna 模型的 API 價格相比 GPT-5.6的促銷價直接降低了50%。此外,OpenAI 還針對基於 GPT-6的開發者優化了提示緩存,默認提供更高的緩存命中率,幫助智能體重用更多上下文,從而實現更快的響應並進一步節省費用。在核心性能表現上:業務流程與智能體表現:在 AutomationBench 跨應用業務流程測試中,GPT-6Sol 在高強度下表現優於 Claude Opus5,且成本僅為其每任務成本的9%;在 Last Exam 智能體評估中,GPT-6Sol 的得分超越了 Claude Opus5的最高分,同時每任務成本降低60%。事實可靠性:在去標識化的真實世界對話中,GPT-6Sol 的錯誤率約為前代的一半,接近 Astra 級的可靠性,Luna 的事實可靠性也迎來了大幅提升。編程與軟件工程:兩款模型均針對 AI Coding Agent 工作負載進行了深度優化。在 DeepSWE v1.1軟件工程測試中,GPT-6Sol 取得68.8% 的成績,距離最高成績僅差1.1個百分點,單任務成本卻低約80%;

剛剛

OpenAI 宣佈將在 AI 模型開發早期階段引入第三方獨立安全評估

據相關報道,該公司計劃打破傳統的內部閉環測試模式,將第三方獨立機構正式引入 AI 模型開發週期的更早階段,對其進行系統性的安全風險評估。為了確保這一創新機制能夠真正發揮實質性作用,OpenAI 同時明確了此類外部評估得以有效開展的核心優先事項。

剛剛