Opus 5.5來了,性能趕超Fable,成本低至40%

字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.5也已經排在後面,將在幾周後推出。
某種意義上,Astra這腳油門踩下去,Anthropic連換代速度都被一起帶快了。和新模型同時到來的還有一個重置,正好方便用戶體驗。Fable的定位有點尷尬了 既然被認為是衝著Astra來的,那就把它和Astra放在一起看。先說價格,Opus 5.5的API輸入價格是每百萬Token 4美元,輸出20美元;Astra則分別是10美元和50美元。也就是說,Opus 5.5的Token單價只有Astra的40%。兩款模型的上下文沒太大差別,Opus 5.5是100萬Token,Astra是105萬;最大輸出也都是128K Token。Astra的知識截止日期是2026年4月30日,Opus 5.
5則更新到了2026年6月。兩款模型均支持low到max五檔推理強度。而且Opus 5.5相比自家上一代Opus 5也降價了。Opus 5原本是每百萬Token 5美元輸入、25美元輸出,新模型兩邊都降了20%;Anthropic稱,再加上Token使用效率提升,完成一項典型任務的實際成本能比Opus 5低約40%,輸出速度則提高了30%以上。便宜歸便宜,Opus 5.5在跑分上倒是一點沒客氣。在官方展示出的可比較的前6項裡,Opus 5.5拿下4項,給到夯;Astra拿下2項,給到頂級;Fable 5.1一項都沒拿到,已成為過時版本。
尤其是在Anthropic最看重的Coding和Agent能力上,Terminal-Bench 4.0直接從Astra的57.9%衝到了66.4%;FrontierCode也以54.4%壓過Astra的53.3%。不過Astra並沒有被全面反超,在跨應用工作流任務AutomationBench裡仍然以41.4%對40.0%領先,科學Agent測試Terminal-Bench-Science上則以64.6%對58.7%保持優勢。值得注意的是,在另外兩項沒有Astra成績的測試裡,Opus 5.5也繼續超過了Fable 5.1:Computer Use從80.7%升到81.
8%,視覺圖表識別則從88.4%升到89.0%。也就是說,至少在Anthropic公佈的這張大表裡,Fable 5.1面對Opus 5.5幾乎沒有守住一塊陣地。把視角從官方文檔裡移開,第三方評測機構Artificial Analysis已經完成了Opus 5.5的獨立測試。在最新的Intelligence Index裡,Opus 5.5最高(max檔)拿到58分,Astra和Fable 5.1則都是53分。但這裡有一個很有意思的細節:Opus 5.5開到max檔之後,非常能燒Token。根據Artificial Analysis測出的結果,max effort下Opus 5.
5平均每項任務生成約11.9萬Token,Astra則約2.7萬。因此,即使Opus 5.5的Token單價只有Astra四成,使用max effort後,單任務成本反而達到了驚人的5.98美元,而Astra僅為3.26美元。不過,回到默認medium檔,情況就好很多:Opus 5.5拿到51分、每任務1.34美元;Astra是50分、1.54美元;Fable 5.1則是49分、2.98美元。總體來看,Anthropic用四成的價格,把Opus硬生生塞進了Astra和Fable所在的最高能力區間。目前,Opus 5.5已經全平臺上線。
普通用戶可以直接在Claude裡使用,開發者則可以通過Claude Code和API調用,模型ID為claude-opus-5-5;AWS、Google Cloud和Microsoft Azure也已經同步提供。Anthropic還順手提高了Pro、Max、Team和按席位計費Enterprise用戶的五小時使用額度,並提供了一次重置。Fable現在的處境變得多少有點尷尬。尤其是Fable 5.1,9月1日才發佈,滿打滿算只坐了三週最高檔。一個谷歌Flash的更新週期過去,下面的Opus突然追了上來,從性能和定價上兩頭圍剿,把自家“大哥”架在火上烤。這個Fable的檔位,真的還有存在的必要麼?
少一點AI味,多一點自主權 跑分只是一張比較直觀的成績單,相比之下,來看點更“實際”的變化。Anthropic給Opus 5.5生成的文本做了個“去Claude味”的處理。官方的表述是,Opus 5推出之後,他們收到最多的一類反饋,就是寫得太繞、太長,不夠容易讀。於是Opus 5.5專門改了寫作風格:重要信息儘量放在前面,減少行話和一些Claude特有的奇怪措辭,同時更嚴格地遵守用戶給出的寫作規則。效果還挺明顯。Ramp的一名工程師表示,以前最讓他受不了的就是前沿模型的輸出“又長又難讀”,Opus 5.5終於解決了這個問題。有意思的是,雖然Opus 5.
5在說話上“越來越聽勸”,但它在底層行為上反而變得不那麼聽話了。比如Thinking,現在徹底關不掉了。Opus 5雖然默認開啟Adaptive Thinking(自適應思考),但在high及以下檔位,開發者至少還能手動把它關閉;到了Opus 5.5,這個開關直接沒了。模型每一次回答都會進行Adaptive Thinking,用戶只能在low、medium、high、xhigh和max之間控制它到底想多少,不能再要求它“別想了直接回答”。Opus 5.5的默認檔位也從Opus 5的high降到了medium。工具調用也出現了類似的變化。
以前開發者可以通過API裡的tool_choice,硬性規定Claude“這一輪必須調用某個工具”,或者“必須從這些工具裡選一個”。Opus 5.5取消了這套強制工具調用,只剩下auto和none兩個選項:要麼把工具交給Claude,由它決定要不要用、用哪個;要麼徹底不讓它用。想讓它必須調用某個工具,就只能通過prompt去告訴它什麼時候應該調用,不能再從API層面硬塞過去。當然,這不意味著開發者徹底失去了約束能力。嚴格JSON格式仍然可以通過strict tool use保證,也可以使用structured outputs。
但至少在工具調用這件事上,Anthropic正在把更多判斷權交給模型自己。這事兒結合Anthropic最近的產品動作看會更有意思。就在6天前,Anthropic剛把Claude的Chat和Cowork合併成了一個入口。用戶只管說自己要什麼,Claude會自己判斷是簡單回答,還是打開工具、處理文件、跑一個長任務。從Chat還是Cowork的入口,到要不要聯網、要不要Thinking、要不要調用工具,越來越多原本擺在用戶面前的選擇,被交給了Claude。而既然給模型的自主判斷越來越多,Anthropic就必須把安全做得更好。在Anthropic接近2000種場景的自動行為評估裡,Opus 5.
5在幾乎所有模型失調指標上都優於近期Claude模型。Anthropic還專門新增了一項測試,看模型會不會試圖跨過測試環境給它劃定的邊界。結果Opus 5.5嘗試突破邊界的頻率,比Opus 5和Mythos 5.1低了大約85%;剩下的嘗試全部屬於低嚴重程度,而且模型自己進行了報告。過去幾個月,Anthropic已經披露多起Claude在網絡安全測試中越出評測環境、進入真實系統的事故。到了Opus 5.5,這件事已經被直接做成了模型發佈前的專項測試。但Anthropic自己也給這個漂亮數字潑了盆冷水:Opus 5.5經常能夠意識到,自己正在接受評測。
也就是說,一個模型在實驗室裡表現得很老實,並不能保證它到了真實世界裡還會完全一樣。Anthropic明確承認,如何在模型上線前可靠捕獲所有失敗行為,至今仍然是個沒有解決的問題。所以光靠模型自己變得聽話還不夠,模型外面,還需要加一層“護欄”。Opus 5.5是第一款,從發佈第一天起,就採用接近Fable 5.1級別安全機制的Opus模型。網絡安全、生物研究和模型蒸餾等高風險請求都會經過額外限制。比如多數網絡安全任務觸發保護後,會被透明地轉交給更弱的Opus 4.8;生物領域則直接採用Fable 5.1同等級的安全措施,經過審核的研究機構才能申請更完整的能力。
Fable,兩頭受氣以前Claude的產品梯隊很好理解:Sonnet負責日常,Opus承接複雜任務,Fable再往上頂能力上限;更前沿、更受限的能力,則留給Mythos。至於Haiku,便宜模型,又不開源,上次更新甚至是去年10月。但Opus 5.5出現以後,Fable和Opus之間的分層正在變得模糊。Anthropic更新的模型選擇指南里明確表示,如果開發者追求最高能力,官方建議直接從Opus 5.5開始,先優化Prompt,再根據需要提高effort;只有把Opus 5.5開到xhigh甚至max以後,在高難推理和長週期Agent任務上仍然不夠用,才建議換到Fable 5.1。
然而,至少從目前公開跑分看,Fable 5.1還不如Opus 5.5的max檔,價格又更貴,換了也未必能解決問題。今天Opus 5.5已經開始採用接近Fable級別的安全機制,能力也已經追平甚至反超Fable 5.1不少項目。但話又說回來,Fable這個檔位倒也不是真的沒有必要。尷尬的可能只是Fable 5.1。因為Fable上面還有Mythos。Anthropic此前明確表示,Fable 5.1和Mythos 5.1使用的是同一個模型,區別主要在安全限制和開放權限:Fable可以廣泛使用,Mythos則只向經過審核的機構開放,在網絡安全和生命科學等高風險領域擁有更完整的能力。
所以從產品結構上看,Fable至少還給Anthropic留下了一個很有用的中間檔位:Opus負責成熟、廣泛部署的高端能力;Fable承接已經可以公開放出來的前沿能力;再往前,才是受限開放的Mythos。但這個檔位確實很尷尬。下面,Opus靠effort不斷往上伸;上面,Mythos承接著更前沿、更受限的能力。夾在中間的Fable,越來越像一層“緩衝墊”,兩頭受氣。當然,Fable怎麼擺,終究還是Anthropic自己的產品線問題。外面的OpenAI可不會等它慢慢理順。Opus 5.5才上桌,OpenAI立馬放出了GPT-6 Sol和Luna——新一輪價格和性能戰已經打起來了。
Related
相關文章

華為大模型雙子星聯手造物理基模,剛融資數億元
機器人前瞻(公眾號:robot_pro) 作者 | 許麗思 編輯 | 漠影 智東西9月23日報道,近日,物理AI公司息壤開物(XIRRA)已在兩個月內連續完成數億元種子輪及天使輪融資,由敦鴻資產領投,華控基金、三花控股、銀杏谷資本、澤然資本、本堅基金、上海天使會、標樸投資等知名機構跟投。 這家公司由兩位華為大模型核心人物聯手創辦:創始人、CEO李寅曾任華為雲大模型CTO,擁有萬卡級模型訓練及豐富的產業落地經驗;聯合創始人、首席科學家張含望是南洋理工大學教授,長期從事因果機器學習與多模態智能研究。 兩人選擇了一條技術門檻極高的路線:從底層研發原生物理基礎模型(Large Physics Model,LPM),希望通過一套通用底座,將物理智能能力推廣機器人、自動駕駛等不同產業場景,乃至科學計算領域。 這一技術路線已取得階段性成果。在9月16日公佈的WorldArena 2.0全球總決賽榜單中,息壤開物在Track 1視頻質量賽道取得軌跡精度全球第一、物理合規性全球前三的成績。 為什麼一家初創公司,要從底層重新研發一套物理基礎模型? 回看數字AI的發展,在GPT等大語言模型出現之前,自然語言處理(NLP)領域高度依賴單場景定製,不同客戶、不同任務,往往需要單獨開發模型。直到大語言模型出現,越來越多的企業開始基於統一底座開發應用,推動AI1.0時代到來。 如今,AI正加速走向真實物理世界,具身智能融資與產品演示持續升溫,規模化商業落地卻仍面臨挑戰。 機器人換一種物料、換一個工位,往往又要重新採集數據、訓練模型和工程適配。高昂的定製化成本,讓機器人能力難以快速複製到更多場景。 AI 2.0時代,能否也出現一套通用基礎模型,讓機器人具備跨任務、跨本體、跨場景的泛化能力,讓更多行業客戶低成本開發自己的具身大腦? 這正是息壤開物希望探索的問題。該公司本輪募集資金將主要用於原生物理AI模型的

Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token?
Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token? 本文作者: 鄭佳美 2026-09-23 12:10 導語:先壓低判斷成本,再用 Calibration 提升可靠性,最終借 Agent 放大調用量。 先壓低判斷成本,再用 Calibration 提升可靠性,最終借 Agent 放大調用量。 作者丨鄭佳美 編輯丨岑 峰 昨天,大家還在驚歎 Jev 的速度和低成本,今天它又做了一件更誇張的事:給申請到的用戶直接發放 1.2 億 Token 額度。消息出來以後,大家沒有先覺得賺到了,更多冒出的念頭反而是:這不對勁。因為 Jev 本身就極其省 Token。它主要處理分類、路由、評分和概率判斷,不需要像通用大模型那樣生成大段內容,一條短文本輸入可能只有幾十個 Token。按照這種消耗方式,1.2 億 Token 足夠普通應用跑幾百萬次判斷,在輸入足夠短的情況下,調用規模甚至還能繼續往上走。問題也就來了:一個已經靠低價獲得大量討論的模型,為什麼還要繼續往外送這麼大的額度?答案可能藏在 Jev 想做的那門生意裡。它要賣的從來都不是一段生成內容,而是一次判斷,而 1.2 億 Token 正在把這種判斷推向一個過去很少出現的狀態——便宜到開發者幾乎不用考慮次數。011.2 億 Token 到底意味著什麼?從技術上看,這相當於給一個應用塞進了數百萬次低成本決策機會。雷峰網傳統大模型通常圍繞一項完整任務工作,讀入上下文、完成推理、生成結果,一次調用本身就比較重。Jev 的任務顆粒度小得多,它可以只回答一個問題:這段內容屬於哪一類,這幾個工具該選哪一個,這個結果應該保留還是丟棄,當前任務應該繼續還是結束。這意味著 Jev 的 Token 消耗方式天然適合高頻調用。一個 Agent 跑完整條任務鏈,可以在用戶意圖識別、工具選擇、結果篩選、異常處理和狀態檢查等多個位置調

豆包做手機、阿里造平板:AI開始爭奪硬件控制權
識礁Farsight2026.09.23 11:43 · 來自北京全文3182字00:00 / 09:20大廠為何突然集體“變硬”?文 | 識礁Farsight繼豆包推出“第二代豆包手機”後,阿里也開始“變硬”。2026年9月22日,阿里召開2026雲棲大會,展示了仍在研發中的“千問平板”QwenBook。據《晚點LatePost》報道,QwenBook由阿里雲旗下無影團隊打造,定位原生智能體電腦,產品定義和硬件部分由團隊自研。無影過去做雲電腦積累的系統和端雲能力,將融入其中。

螞蟻密算韋韜:企業AI進不了生產,卡點不在模型
TechPulse2026.09.23 11:40 · 來自浙江全文1839字00:00 / 05:57韋韜提到,用自然語言描述不許做什麼這類紅線時,大語言模型的違背率超過80%。企業AI的下一道門檻,落在了一個比模型能力更難工程化的問題上。

韶音首款 AI 耳機 OpenFit 2 AI 亮相雲棲大會,重磅首發“AI 實驗室”四大新功能
作為開放式耳機領域的領頭羊,Shokz 韶音首次重磅參展,不僅攜旗下首款 AI 耳機 OpenFit2AI 核心亮相,更在現場聯合光帆科技首發了“AI 實驗室”全新功能,全面展現了 Qwen 大模型在音頻可穿戴設備中的深度產業落地。作為韶音佈局智能音頻賽道的開山之作,OpenFit2AI 深度融合了通義千問(Qwen)大模型的強大能力,集長時錄音、AI 會議紀要生成與多語種實時翻譯於一體。

GPT-6 Sol和Luna上線,打折比梁文鋒還狠
字母AI2026.09.23 11:08 · 來自北京全文5453字00:00 / 14:27Opus 5.5發佈90分鐘,OpenAI來打價格戰了。文 | 字母AI今夜註定無眠。Opus 5.5剛剛發佈90分鐘,OpenAI就把GPT-6 Sol和Luna一起端了上來。前腳Anthropic剛把Opus的價格砍了一刀,後腳OpenAI直接把刀砍得更深。GPT-6 Sol每百萬Token輸入只要2美元、輸出10美元,價格正好只有Opus 5.5的一半,Astra的五分之一。Luna更誇張,只要0.1美元和0.