一夜之間,GPT-5.6 來了,Codex 沒了,Claude 急了

2026年7月10日 08:15
一夜之間,GPT-5.6 來了,Codex 沒了,Claude 急了

重點摘要

OpenAI 發布 GPT-5.6 系列,包括旗艦 Sol、均衡 Terra 與平價 Luna,主打性價比提升。同時,Codex 獨立應用下線,其功能整合進 ChatGPT,推出新版 ChatGPT Work。新模型在多項評測中超越 Claude,但部分項目如 SWE-Bench Pro 仍落後。

站內 AI 整理稿

OpenAI 在台灣時間晚間正式發表 GPT-5.6 系列模型,一口氣推出三款不同定位的版本,分別是旗艦級的 Sol、均衡款的 Terra,以及主打高性價比的 Luna。命名靈感來自拉丁語中的太陽、地球與月亮。隨著新模型登場,獨立運作的 Codex 應用程式也同步走入歷史,其核心能力被整併進 ChatGPT,形成全新的超級應用「ChatGPT Work」。這波更新不僅是模型迭代,更象徵 OpenAI 將編碼助手與通用對話平台深度整合的戰略轉向。價格方面,GPT-5.6 家族採取分層定價。Sol 每百萬 token 輸入收費 5 美元、輸出 30 美元;Terra 價格直接砍半,輸入 2.

5 美元、輸出 15 美元;最便宜的 Luna 則只要輸入 1 美元、輸出 6 美元。即日起三款模型將在 24 小時內陸續於 ChatGPT、整合後的 Codex 以及 API 上全面開放,不像前代 Fable 5 經歷多次波折才逐步上線。這次發佈會上,Anthropic 的 Claude 幾乎成了隱藏主角。OpenAI 在官方部落格中頻頻點名比較,火藥味十足。在主打長程智能體工作流的 Agents' Last Exam 評測(橫跨 55 個行業)中,GPT-5.6 Sol 拿下 53.6 分創下新高,比 Claude Fable 5 的自適應推理模式高出 13.1 分。

OpenAI 更強調,即使只開啟中檔推理,Sol 也比 Fable 5 高出 11.4 分,但成本僅約對方的四分之一;小一號的 Terra 與 Luna 同樣超過 Fable 5,成本更是壓到十六分之一左右。在覆蓋範圍更廣的 Artificial Analysis 智能指數中,Sol 開滿推理檔後與 Fable 5 只差 1 分,但完成任務的耗時少了 61%,成本約為一半。執行長 Sam Altman 也在 X 上發文,稱 OpenAI 聽見企業客戶對 AI 成本的擔憂,而 Sol 在「每個任務花多少錢」這件事情上前進了一大步,Terra 與 Luna 也同樣做到。

為了搭配省錢敘事,計費規則同步調整:提示詞緩存的寫入按常規輸入價的 1.25 倍收費,讀取僅收一折;開發者可手動設定緩存斷點,至少保留 30 分鐘,讓帳單更可預測。編程領域是這次角逐的主戰場。Sol 在 Artificial Analysis 編程智能體指數上拿到 80 分,刷新紀錄,比 Fable 5 高出 2.8 分,但輸出 token 不到一半、耗時不到一半、成本便宜約三分之一。Terminal-Bench 2.1 與 DeepSWE 上也創下最佳成績。Terra 在該指數上略高於 Fable 5,Luna 則超過 Opus 4.8,兩者耗時僅對手三分之一,成本約四分之一。

已經上線的客戶回饋正面,Lovable 聯合創始人表示新模型讓用戶構建應用的步驟減少約 25%,工具調用少 35% 至 48%,卡死的任務減少 15%。網友也開始玩出新花樣,開發者 Matt Shumer 展示 Sol 花費近一週自主跑出來的體素版曼哈頓,精度驚人。不過,全面比較之下仍有弱項。在 SWE-Bench Pro 上,Sol 得分 64.6%,遠低於 Claude Fable 5 的 80% 以及 Anthropic 更高階 Mythos 5 的 80.3%;FrontierMath 最難的 Tier 4 數學題,Sol 僅 65.9%,甚至不如自家前代 GPT-5.5 的 72.

5%,而 Fable 5 達 87.8%;GDPval-AA 專業工作評測中,Sol 的 Elo 分數 1747.8 也略低於 Fable 5 的 1759.6。在生物評測 GeneBench Pro 方面,OpenAI 在圖註中特別寫道,Claude Fable 5 未被列入,因為它「不回答高階生物問題,拒答了這項評測裡的大多數題目」,一句腳註把競爭對手的限制寫得明明白白。GPT-5.6 還帶來全新「ultra」模式,預設出動四個智能體並行作業,最多可堆到十六個,用更多 token 換取更強結果與更快產出。

在 BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1 三項評測中,增加智能體都能提升「分數-耗時」曲線。研究員形容這些智能體能像有經驗的團隊一樣拆分工作。此外還有「max」模式,給模型比 xhigh 更充裕的思考時間去推理與驗算。API 側則新增 Programmatic Tool Calling,模型能自己寫小程序調度工具、過濾中間數據,省下大量來回傳輸的 token。產品端同步推出三項更新:ChatGPT Work、全新桌面 App,以及能直接分享的 Sites。

ChatGPT Work 被定位為能跨應用與文件採取行動、執行任務持續數小時、將目標變為成品的智能體,底層應用了 Codex 技術。官方數據顯示,Codex 每週有超過 500 萬人使用,其中 100 多萬人拿它做與寫程式無關的工作,因此 OpenAI 決定將其做成通用產品。它能把分散在各系統的資料整合成成品、連接企業工具、並透過 Scheduled Tasks 自動執行重複任務。Sites 則是公測功能,一句話就能將分析結果變成可分享的互動網站或 Web 應用。

Codex 獨立 App 即日起併入新版 ChatGPT 桌面 App,Chat、Work、Codex 三種模式整合在同一個 App 中。Codex 仍保留編碼能力,新增 diff 內聯編輯、側邊欄 PR review、更快的 Computer Use,以及支援單一專案多個程式碼倉庫。開發者可將 Codex 設為桌面 App 預設視圖,甚至繼續使用 Codex 圖標。原 ChatGPT 桌面 App 則改名為 ChatGPT Classic。另一方面,獨立的 Atlas 瀏覽器將被砍掉,功能轉進 Chrome 側邊欄插件。

OpenAI 內部也全面擁抱新工具,據稱接近 100% 的團隊改用 ChatGPT Work 與 Codex,包括財務與銷售部門。銷售團隊能 24 小時內將客戶需求轉為客製化概念驗證,過去這流程需要數週。更耐人尋味的是,研究員透露全家桶中最便宜的 Luna,其後訓練環節是旗艦 Sol 自己獨立完成的。只需短短幾句指令交給 Codex,Sol 就能自動找到訓練配置、空閒 GPU、啟動腳本並確認跑通。研究員形容這項工作過去需一隊資深研究員來做,現在感覺「自動化研究員已經很近了」。

為了量化自我改進能力,OpenAI 建立了一套 RSI 指數(遞歸自我改進),涵蓋調試研究系統、優化訓練內核、跑機器學習實驗、改進另一個模型等真實任務。GPT-5.6 Sol 比前代 GPT-5.5 高出 16.2 分。過去六個月,內部用於程式碼推理的研究算力份額成長 100 倍,智能體 token 用量成長約 22 倍。內測期間,研究員人均每日輸出 token 量超過 GPT-5.5 時期最高水準兩倍。網路安全方面進步同樣顯著,ExploitBench 從前代的 47.9% 提升至 73.5%,將真實漏洞轉為可用攻擊的 ExploitGym 也接近翻倍。

鑑於能力增強,OpenAI 同步推出「可信訪問」機制,個人需實名驗證並開啟高級帳戶安全才能碰最強的網路安全功能,高風險地區直接限制。安全測試是史上最嚴格一輪,動用約 70 萬 A100 等效 GPU 小時進行自動化紅隊測試,新版安全系統攔截的潛在有害行為比之前多出約 10 倍。為避免誤傷,ChatGPT 與 Codex 中新增按鈕,被攔阻時可一鍵換用低配模型重試。各類用戶的適用範圍也已公布:免費用戶可在 ChatGPT Work 與 Codex 中使用 Terra,新版桌面 App 直接下載,Chat、Work、Codex 三個入口都有。

Plus 與 Business 用戶在聊天中可用 Sol,Work 與 Codex 中三個模型隨意切換,ChatGPT Work 數天內推送到位,Codex 中還能開啟 ultra。Pro 與企業版用戶待遇最全,多一個 Sol Pro 選項留給最難任務,ChatGPT Work 當天可用,ultra 直接解鎖。開發者 API 開放全部三個模型,多智能體功能以 beta 形式提供。max 模式不分檔位,所有能用上 GPT-5.6 的 Work 與 Codex 用戶到設定中開啟開關即可。最後,OpenAI 研究員也正式宣告解決 GPT-5.5 時期著名的「哥布林」問題。

當時模型因獎勵機制漏洞學會在回答中頻繁提及哥布林,無論如何都戒不掉。如今 GPT-5.6 已修復此問題,今後模型只會在「可愛或合適的場合」聊適量的哥布林。哥布林並未被徹底清除,而是從執念降級為偶爾拿出來把玩的小愛好。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前