剛剛,GPT-5.6「太陽系」全家桶上線,Codex消失了

重點摘要
OpenAI 今日正式將 GPT-5.6 系列模型一次全數推出,代號分別為 Sol、Terra 與 Luna,象徵太陽、大地與月亮,正式宣告「全家桶」全面上線。與此同時,ChatGPT 與 Codex 兩款應用程式也完成合併,未來將不再有獨立的 Codex 產品,所有功能統一整合至全新的 ChatGPT 平台。 GPT-5.6 旗艦模型 Sol 被定位為目前最強的編碼與知識工作模型,專為處理高難度的編程、網路安全與科學研究任務而生。
OpenAI 今日正式將 GPT-5.6 系列模型一次全數推出,代號分別為 Sol、Terra 與 Luna,象徵太陽、大地與月亮,正式宣告「全家桶」全面上線。與此同時,ChatGPT 與 Codex 兩款應用程式也完成合併,未來將不再有獨立的 Codex 產品,所有功能統一整合至全新的 ChatGPT 平台。GPT-5.6 旗艦模型 Sol 被定位為目前最強的編碼與知識工作模型,專為處理高難度的編程、網路安全與科學研究任務而生。在多項評測中,Sol 的表現直接壓制了競爭對手 Anthropic 推出的 Claude Fable 5。
在 Agents' Last Exam 測試中,Sol 拿下 53.6% 的成績,領先 Fable 5 達 13.1 分;在 Terminal-Bench 2.1 中,Sol 取得 88.8%,開啟 Ultra 模式後更達到 91.9%,而 Fable 5 僅有 83.1%。在 Coding Agent Index 這項專注於編程能力的指標上,Sol 以 80 分刷新目前最佳紀錄,高出 Fable 5 約 2.8 分。更令市場矚目的是 OpenAI 在定價策略上的強勢進擊。
Fable 5 每百萬輸入 token 收費 10 美元,輸出為 50 美元;Sol 則直接砍半,分別僅需 5 美元與 30 美元。Terra 的定價再砍半,來到 2.5 美元與 15 美元;而最小規格的 Luna 更是僅需 1 美元與 6 美元,試圖以極致性價比搶攻市場。除了價格與性能,GPT-5.6 還引入了全新的運算模式。此次新增了 max 與 ultra 兩檔高能力設定。max 模式會給予模型更多推理時間以提升結果品質;ultra 模式則預設同時啟動四個代理(Agent)並行工作,遇到更重的任務時甚至可擴展到十六個 Agent 同時運算。
OpenAI 表示,這項設計能在短時間內用更多 token 換取更強、更快的結果。在 BrowseComp、SEC‑Bench Pro 與 Terminal‑Bench 2.1 等評測中,啟用並行 Agent 後,分數與執行時間的曲線明顯向上提升。GPT-5.6 的另一項重大突破在於設計與審美能力。模型能夠自行檢視渲染後的成果,檢查視覺與功能上的瑕疵,並直接進行修改,最後再將成品交付使用者。從 OpenAI 公布的範例來看,GPT-5.6 設計的航海小遊戲、博物館網站與室內設計展示,都展現出過去模型難以企及的品質。在端到端知識工作方面,Sol 在 BrowseComp 拿下 92.
2%,在 OSWorld 2.0 更以 62.6% 的成績刷新紀錄,且比 Opus 4.8 少用了 85% 的輸出 token。更為關鍵的是,OpenAI 在這一代模型中實現了「AI 訓練 AI」的循環。官方指出,GPT-5.6 是該公司迄今最能加速 AI 研究進展的模型。研究人員運用它來診斷系統故障、優化訓練流程、執行實驗並解讀結果。在內測期間,每位活躍研究員的日均輸出 token 量,已達到 GPT-5.5 最高水準的兩倍以上。過去半年,OpenAI 投入內部編程推理的研究算力份額成長了 100 倍,內部 Agent 的 token 用量則增加約 22 倍。
根據內部評估,Sol 在一套衡量「遞迴自我改進」(RSI)的指標上,比 GPT-5.5 高出 16.2 分。研究員在發佈會上透露,全家桶中最小型的 Luna,正是由老大哥 Sol 親手完成後訓練。過程是 Sol 先接收大致需求,然後自行尋找訓練配置、挑選 GPU、啟動腳本並確認執行無誤,將整個模型後訓練流程從頭到尾一肩扛起。在過去,這樣的工作需要一整隊資深研究員才能完成。除了模型本身,OpenAI 也同步推出了重量級產品 ChatGPT Work。
這是一個能夠跨應用程式與檔案自主運作的代理(Agent),可以持續數小時追蹤同一個專案,逐步將目標轉化為實際成品,定位上直接對標 Anthropic 的 Claude Cowork。ChatGPT Work 不僅支援桌面環境,使用者也能透過手機端的 ChatGPT 直接操控,即使電腦不在身邊,也能遠端推動工作進度。桌面端的 ChatGPT 也迎來重大升級,新增內建瀏覽器與 Computer Use 功能,能夠直接調用使用者本機的檔案與應用程式,模擬點擊、打字與搬移檔案等操作。
最重要的變革在於,原本獨立的 Codex 應用程式已完全併入全新的 ChatGPT 桌面端,從此 OpenAI 旗下的應用產品只剩一個 ChatGPT。從 6 月 27 日初次亮相到今日全面上線,僅過了半個月。OpenAI 在短短時間內從追趕轉為反超,但真正震撼業界的並非榜單上的數字,而是 GPT-5.6 Sol 親手訓練出 Luna 的事實。當 AI 開始自行加速下一世代 AI 的誕生,時間的推進已經不再是線性的進程,這或許正是當今 AI 競賽最令人敬畏的註腳。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
騰訊雲開源 TencentDB Agent Memory v2.0:專為 AI 編碼代理打造的團隊級記憶中樞
Tencent Cloud has open-sourced TencentDB Agent Memory v2.0, a team-level memory hub for AI agents. The idea is super simple: if project context was already explained once, a new session should not need it repeated.
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。