MarkTechPost AI生成式AI

OpenAI Releases GPT-5.6 (Sol, Terra, Luna): A Three-Tier Model Family With Programmatic Tool Calling in the Responses API

2026年7月9日 20:45

重點摘要

OpenAI just moved the GPT-5.6 family to general availability, following a limited preview. The release ships three models rather than one.

站內 AI 整理稿

OpenAI 於今日正式將 GPT-5.6 系列模型全面開放使用,結束了先前的限量預覽階段。此次推出的並非單一模型,而是一個由三個不同定位的版本組成的家族:旗艦級 Sol、日常平衡款 Terra,以及最高成本效益的 Luna。這三個模型涵蓋從輕量到高強度運算的多種應用場景,並在 Responses API 中首次引入程式化工具呼叫(Programmatic Tool Calling)與多代理(multi-agent)測試功能。價格方面,GPT-5.6 系列按每百萬個 tokens 計費,三款模型各有不同定價。Sol 的輸入價格為 5 美元、輸出價格為 30 美元;Terra 為輸入 2.

5 美元、輸出 15 美元;Luna 則最為經濟,輸入僅需 1 美元、輸出 6 美元。在 ChatGPT 介面中,Plus、Pro、Business 與 Enterprise 用戶可存取 Sol,並可選擇中等或更高 effort 設定;Pro 與 Enterprise 用戶還可進一步選用 GPT-5.6 Sol Pro。在 ChatGPT Work 與 Codex 環境中,免費與 Go 等級用戶預設使用 Terra,而付費用戶則可在三個模型間自由切換,並為每個模型單獨設定 effort 等級。所有具備 GPT-5.6 存取權限的用戶都能在設定中啟用最高 effort 的 max 模式。

API 端則完整開放三個模型的所有功能。效能表現是 GPT-5.6 最受矚目的焦點。在 Artificial Analysis Coding Agent Index v1.1 上,Sol 在 max reasoning 模式下獲得 80 分,比 Anthropic 的 Claude Fable 5 高出 2.8 分,且 OpenAI 表示 Sol 僅用了不到一半的輸出 tokens 與不到一半的時間達到此成績。在 Terminal-Bench 2.1 與 DeepSWE 兩項基準測試中,Sol 創下了新的業界最佳紀錄。

當啟用 ultra 模式(平行運行四個代理)時,Sol 可將 Terminal-Bench 2.1 分數從 88.8% 進一步提升至 91.9%。另外,Sol 在 BrowseComp 上達到 90.4%,而在 OSWorld 2.0 則拿下 62.6%,超越 Claude Opus 4.8 的 54.8%,同時使用的輸出 tokens 減少了 85%。OpenAI 也公布了 Sol 在 Agents' Last Exam 上的成績,該測試橫跨 55 個領域評估長期專業工作流程。OpenAI 報告 Sol 創下 53.6 的新高,比 Claude Fable 5(自適應推理)高出 13.

1 分;不過官方評估表格中 Sol 列為 52.7%,而 Fable 5 為 40.5%,兩者差距同樣為 13.1 分,但 Sol 的數字略有出入,OpenAI 並未說明哪個配置產生 53.6 的結果。整體來說,GPT-5.6 Sol 在多項指標上展現了強勁的競爭力,尤其在需要密集推理與工具使用的程式碼生成任務上表現突出。儘管 Sol 在多個領域取得領先,仍有四個主要缺口值得關注。首先是軟體工程評估 SWE-Bench Pro,Sol 得分 64.6%,而 Claude Mythos 5 高達 80.

3%、Claude Fable 5 也達 80%,落後約 15 個百分點,這是一個被廣泛關注的程式碼評估項目。其次,在廣泛的智慧與知識工作方面,Claude Fable 5 於 Artificial Analysis Intelligence Index v4.1 上以 59.9 分小幅領先 Sol 的 58.9 分;在 GDPval-AA v2 Elo 評分中 Fable 5 也領先約 12 分;在 HealthBench Professional 上,Fable 5 獲得 60.9%,Sol 為 60.5%。

第三,在工具使用測試 Toolathlon 中,Sol 的 58% 落後於 Fable 5 的 61.7% 與 Opus 4.8 的 59.9%,且值得注意的是,Luna 在此項目上反而超越了 Terra,打亂了原本的層級順序。最後,長上下文處理能力方面,Luna 在 OpenAI MRCR v2 的 8-needle 測試中表現較弱,無論在 256K–512K 或 512K–1M 範圍內都僅有 41.3%;Sol 在 512K–1M 下為 73.8%,略低於 GPT-5.5 的 74%。GPT-5.6 系列還帶來了多項基礎設施更新。

Responses API 中新增了程式化工具呼叫功能,允許模型在隔離的 V8 執行環境中執行 JavaScript 程式碼,且無網路存取權限,提升安全性。同時,多代理測試版也在同一 API 中開放,ultra 模式即為此功能之一。提示快取(Prompt caching)機制也有所調整:GPT-5.6 支援明確的快取斷點,並設有 30 分鐘的最短快取生命週期;快取寫入將以模型未快取輸入費率的 1.25 倍計費,而快取讀取則繼續享有 90% 的折扣。綜合來看,GPT-5.

6 以三層級策略進攻不同市場:Sol 瞄準高強度編碼與複雜推理任務,Terra 服務日常開發與一般應用,Luna 則為成本敏感場景提供輕量方案。然而,其在 SWE-Bench Pro 與部分知識工作基準上的落後,顯示與 Anthropic 的 Claude 系列仍有差距。OpenAI 希望透過程式化工具呼叫與多代理協作等新功能,吸引開發者選用 Responses API 打造更自動化的 AI 工作流程。隨著模型正式上線,外界也將持續關注其在實際應用中的表現。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

13 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前