剛剛,GPT-5.6「太陽系」全家桶上線,Codex消失了

重點摘要
OpenAI 今日正式將 GPT-5.6 系列模型一次全數推出,代號分別為 Sol、Terra 與 Luna,象徵太陽、大地與月亮,正式宣告「全家桶」全面上線。與此同時,ChatGPT 與 Codex 兩款應用程式也完成合併,未來將不再有獨立的 Codex 產品,所有功能統一整合至全新的 ChatGPT 平台。 GPT-5.6 旗艦模型 Sol 被定位為目前最強的編碼與知識工作模型,專為處理高難度的編程、網路安全與科學研究任務而生。
OpenAI 今日正式將 GPT-5.6 系列模型一次全數推出,代號分別為 Sol、Terra 與 Luna,象徵太陽、大地與月亮,正式宣告「全家桶」全面上線。與此同時,ChatGPT 與 Codex 兩款應用程式也完成合併,未來將不再有獨立的 Codex 產品,所有功能統一整合至全新的 ChatGPT 平台。GPT-5.6 旗艦模型 Sol 被定位為目前最強的編碼與知識工作模型,專為處理高難度的編程、網路安全與科學研究任務而生。在多項評測中,Sol 的表現直接壓制了競爭對手 Anthropic 推出的 Claude Fable 5。
在 Agents' Last Exam 測試中,Sol 拿下 53.6% 的成績,領先 Fable 5 達 13.1 分;在 Terminal-Bench 2.1 中,Sol 取得 88.8%,開啟 Ultra 模式後更達到 91.9%,而 Fable 5 僅有 83.1%。在 Coding Agent Index 這項專注於編程能力的指標上,Sol 以 80 分刷新目前最佳紀錄,高出 Fable 5 約 2.8 分。更令市場矚目的是 OpenAI 在定價策略上的強勢進擊。
Fable 5 每百萬輸入 token 收費 10 美元,輸出為 50 美元;Sol 則直接砍半,分別僅需 5 美元與 30 美元。Terra 的定價再砍半,來到 2.5 美元與 15 美元;而最小規格的 Luna 更是僅需 1 美元與 6 美元,試圖以極致性價比搶攻市場。除了價格與性能,GPT-5.6 還引入了全新的運算模式。此次新增了 max 與 ultra 兩檔高能力設定。max 模式會給予模型更多推理時間以提升結果品質;ultra 模式則預設同時啟動四個代理(Agent)並行工作,遇到更重的任務時甚至可擴展到十六個 Agent 同時運算。
OpenAI 表示,這項設計能在短時間內用更多 token 換取更強、更快的結果。在 BrowseComp、SEC‑Bench Pro 與 Terminal‑Bench 2.1 等評測中,啟用並行 Agent 後,分數與執行時間的曲線明顯向上提升。GPT-5.6 的另一項重大突破在於設計與審美能力。模型能夠自行檢視渲染後的成果,檢查視覺與功能上的瑕疵,並直接進行修改,最後再將成品交付使用者。從 OpenAI 公布的範例來看,GPT-5.6 設計的航海小遊戲、博物館網站與室內設計展示,都展現出過去模型難以企及的品質。在端到端知識工作方面,Sol 在 BrowseComp 拿下 92.
2%,在 OSWorld 2.0 更以 62.6% 的成績刷新紀錄,且比 Opus 4.8 少用了 85% 的輸出 token。更為關鍵的是,OpenAI 在這一代模型中實現了「AI 訓練 AI」的循環。官方指出,GPT-5.6 是該公司迄今最能加速 AI 研究進展的模型。研究人員運用它來診斷系統故障、優化訓練流程、執行實驗並解讀結果。在內測期間,每位活躍研究員的日均輸出 token 量,已達到 GPT-5.5 最高水準的兩倍以上。過去半年,OpenAI 投入內部編程推理的研究算力份額成長了 100 倍,內部 Agent 的 token 用量則增加約 22 倍。
根據內部評估,Sol 在一套衡量「遞迴自我改進」(RSI)的指標上,比 GPT-5.5 高出 16.2 分。研究員在發佈會上透露,全家桶中最小型的 Luna,正是由老大哥 Sol 親手完成後訓練。過程是 Sol 先接收大致需求,然後自行尋找訓練配置、挑選 GPU、啟動腳本並確認執行無誤,將整個模型後訓練流程從頭到尾一肩扛起。在過去,這樣的工作需要一整隊資深研究員才能完成。除了模型本身,OpenAI 也同步推出了重量級產品 ChatGPT Work。
這是一個能夠跨應用程式與檔案自主運作的代理(Agent),可以持續數小時追蹤同一個專案,逐步將目標轉化為實際成品,定位上直接對標 Anthropic 的 Claude Cowork。ChatGPT Work 不僅支援桌面環境,使用者也能透過手機端的 ChatGPT 直接操控,即使電腦不在身邊,也能遠端推動工作進度。桌面端的 ChatGPT 也迎來重大升級,新增內建瀏覽器與 Computer Use 功能,能夠直接調用使用者本機的檔案與應用程式,模擬點擊、打字與搬移檔案等操作。
最重要的變革在於,原本獨立的 Codex 應用程式已完全併入全新的 ChatGPT 桌面端,從此 OpenAI 旗下的應用產品只剩一個 ChatGPT。從 6 月 27 日初次亮相到今日全面上線,僅過了半個月。OpenAI 在短短時間內從追趕轉為反超,但真正震撼業界的並非榜單上的數字,而是 GPT-5.6 Sol 親手訓練出 Luna 的事實。當 AI 開始自行加速下一世代 AI 的誕生,時間的推進已經不再是線性的進程,這或許正是當今 AI 競賽最令人敬畏的註腳。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。