Opus 5.2 與 Gemini 4 Pro 未經官宣已上線,前沿模型的發佈流程正在被壓縮

2026年9月20日 18:27
Opus 5.2 與 Gemini 4 Pro 未經官宣已上線,前沿模型的發佈流程正在被壓縮
站內 AI 整理稿

AGI-Signal2026.09.20 18:25 · 來自海外全文2787字00:00 / 07:27沒人開發佈會。可硅谷這一週,比任何發佈會都熱鬧。過去兩週,Anthropic 將兩個尚未命名的模型接入生產接口,谷歌為下一代旗艦沿用舊版本號、投放到第三方盲測平臺,OpenAI 在 Astra 之後未再公開發聲。三家都沒有為下一代模型開發佈會,官方也沒有發佈任何說明。多數人並未意識到,自己已在為尚未發佈的模型提供測試樣本。9 月 17 日晚,Anthropic 切斷了灰度通道。一批原本被路由至新模型的賬號歸零,在開發者社區引發集中討論。

一天後通道恢復,覆蓋範圍從 Claude Code 擴大至 Chat 和 Cowork。有開發者把這段經歷稱為“午夜驚魂”。當天晚上,谷歌也被發現了。第三方盲測平臺 Arena 上出現了一個名稱並不起眼的模型,代號 gemini-3.8-flash。抽到該模型的用戶很快注意到異常:它繪製的鵜鶘帶有完整的蹬踏動作,生成一張 PS5 矢量圖需十分鐘、輸出數千行代碼,搭建的體素寶塔可在瀏覽器中實時旋轉。3.8 Flash 是早已上線的輕量模型,不具備這樣的能力。社區隨後判斷,這是谷歌下一代旗艦 Gemini 4 Pro,內部代號 Argon。被發現後,該名稱又被改為 gemini-3.

7-flash。再往前三天,有開發者發現,Claude Code 界面調用的模型標註為 Opus 5,返回結果卻來自另一個模型。對接口請求的抓取顯示,後端模型標識已指向 5.2。Opus 5 發佈於 7 月 24 日,其間沒有 5.1,版本號直接跳至 5.2。此後 Fable 5.2 灰測的消息一併傳出,一部分原本調用 Fable 5.1 的請求被後臺路由至新的檢查點。沒有模型卡,沒有 API 標識,也沒有定價表,Anthropic 未作任何說明。

把新模型先接進現有產品三家做法並不相同,Anthropic 採用後端路由,前端仍顯示舊名稱,普通用戶無從察覺;谷歌的方式更簡單,在第三方盲測平臺上沿用舊版本號;OpenAI 則在 Astra 發佈之後未再公開發聲,公開議題轉到了對手之間的對比上。對廠商而言,這樣做的收益相當直接,模型在尚未正式命名的階段即可獲得真實負載下的表現數據,一旦出現問題可以隨時回退,無需承擔公開發布失敗的風險。一個前沿模型正式發佈,意味著需要提前配置足以承接瞬時峰值的算力。

GPT-6 Astra 動用得州 Stargate 基地超過 10 萬張 GPU 完成訓練,API 定價為每百萬輸入 10 美元、每百萬輸出 50 美元,是上一代 Sol 的 2.5 倍。灰度路由的算力投入遠低於此:新模型混入舊模型流量,廠商可以控制被路由至新模型的請求比例,在觀察真實表現的同時逐步提高佔比。比成本更難處理的是容錯。6 月 9 日,Fable 5 與 Mythos 5 發佈;三天後的 6 月 12 日,美國商務部下發出口管制指令,要求暫停向任何外籍人士提供這兩個模型。

由於無法實時核驗用戶國籍,Anthropic 將模型對全球用戶下線,直到 7 月 1 日 Fable 5 才恢復訪問。一次全量發佈,換來一次全量下架。此後,團隊再做發佈,都會傾向先小範圍釋放、觀察反饋。口碑的影響更難量化:用戶調用的是 Opus 5,實際得到的是 5.2,體驗改善明顯,卻難以歸因。等到開發者社區開始流傳“Claude Code 最近變強了”,傳播已經完成,而官方未作任何說明。為什麼放棄發佈會環節就在 Opus 5.2 被發現的兩天前,Anthropic CEO 達里奧·阿莫代伊發表長文,主張全行業主動放慢前沿模型的迭代速度。

他的理由是,模型能力增長過快,安全與對齊工作已經難以跟上;若能放慢一至兩年,並將這段時間用於安全研究,風險將明顯下降。文章發出後,馬斯克與 OpenAI 的奧特曼均公開表示支持。奧特曼還提到一項具體安排:出於安全考慮,OpenAI 今年不會上市。市場的反應很快,隨後的第一個交易日,費城半導體指數下挫 5.86%,英偉達下跌 3.36%,全球半導體與 AI 算力硬件產業鏈當日市值蒸發超過 5000 億美元。這幾天裡,Claude Code 中的新檢查點仍在運行。

三家的處境並不相同,OpenAI 月初發布的 GPT-6 Astra 目前佔據約 13% 的企業 AI 支出,Anthropic 的 Fable 系列約為 8%。Anthropic 正在籌備上市,6 月已秘密提交申請,目標估值最高 2 萬億美元,時間窗口定在 11 月中期選舉之前。在這一節點上,一次體驗不佳的主力模型發佈會,會成為路演材料中的不利因素,而 Opus 5 的市場口碑本就偏弱。谷歌的處境更為被動:旗艦 Pro 系列已空缺數月,3.5 Pro 被擱置,算力集中投向 Gemini 4,產品線暫時只能由 Flash 系列支撐。ARC-AGI-3 的 99.9% 和 62.

7%灰測期間流傳較廣的一種說法,是“Fable 5.2 在最高推理檔位下碾壓了 GPT-6 Astra”。在筆者看來,這一說法需要分兩層看。它來自一位開發者的個人對比測試,原話是“輸出看起來明顯優於 Astra”,且該開發者同時指出代價是更慢、更貴。另一層背景是,Anthropic 上一代模型本已領先:在 Artificial Analysis 的綜合智能指數中,Fable 5.1 為 66,Astra 為 61;編碼智能體指數則為 70 比 67。因此“5.2 碾壓 Astra”未必是誤判,但差距的一部分來自 Astra 自身的基準設置。

OpenAI 發佈 Astra 時主推的一項成績,是 ARC-AGI-3 得分 99.9%。但該成績取自 OpenAI 自行配置的 harness;換用行業標準 harness 測同一個模型,得分降至 62.7%,相差 37 個百分點。三個時間點之間的間隔只有十四天:9 月 3 日 GPT-6 Astra 發佈,9 月 14 日 Anthropic 將下一代模型接入接口,9 月 17 日谷歌跟進。接下來有三個時間節點可供確認:Opus 5.

2 最快 9 月底、最晚 10 月底全面開放;Gemini 4 Pro 預計 10 月正式發佈;以及 OpenAI 是否會推出新模型,回應這一次“被灰測超越”。預測市場上,9 月 30 日前發佈新 Opus 的概率一度超過八成。截至目前,Opus 5.2 與 Gemini 4 Pro 均無模型卡、API 標識和定價信息。三家公司都尚未正式表態。(本文首發APP,作者 | AGI-Signal,編輯|秦聰慧)

Related

相關文章

一顆 260 克的"雞蛋關節":稚暉君發佈啟元 Q1、T1 人形機器人

T1 人形機器人發佈於AI新聞資訊發佈時間 :2026年9月20號 17:09閱讀 :1分鐘9月20日,在2026啟元機器人全球產品發佈會上,上緯新材旗下消費級人形機器人品牌上緯啟元正式發佈啟元 Q1、啟元 T1兩款人形機器人。上緯新材料科技股份有限公司董事長、智元機器人聯合創始人兼首席技術官彭志輝(稚暉君)介紹,啟元 Q1主打自定義特性,支持自定義設計互動動作與3D 打印改造外觀,用戶可自由調整機器人的外觀造型、性格特質、動作姿態與語音音色。

剛剛

微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”

它的定位可以概括為一句話:讓知識庫不只是“能查到答案”,而是“能動手去執行”。WeKnora 想解決的是大模型落地時最現實的問題——知識躺在文檔裡,模型說得頭頭是道,但要把它們變成可驗證的結果,中間缺一雙手腳。anydoc 解析 + GraphRAG,把雜亂文檔變成知識圖譜第一個亮點是 anydoc 解析:PDF、Word、Markdown、網頁等多種格式可直接導入,無需預先轉換;配合 Wiki 模式,能把雜亂的文檔自動整理成結構化的知識體系。

剛剛
量子位生成式AI

APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策

9月19日,中國人工智能企業APUS旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果 9月19日,中國人工智能企業APUS(麒麟合盛網絡技術股份有限公司)旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果,幷包裝成了開箱即用的Agent Skill fast-browser-use,支持純本地模型離線執行。

剛剛
量子位生成式AI

谷歌AI首次“越獄”:竟然自己破解密碼入侵三家公司!

? 來,一起看下Gemini新鮮出爐的事故。 事情的起因,是一家名叫Irregular的AI安全公司,組織了一場“奪旗”(Capture the Flag)演練,要求是讓模型從一家虛構的公司系統裡拿到一段秘密信息。 而這個測試環境原本不應該具備聯網能力的,但問題也恰恰出在了這裡。由於一些bug,公網訪問被意外打開了;更巧的是,演練裡設定的那家虛構公司,和現實中一家真實企業重名。

剛剛