GPT-5.6全量放送,Codex正式併入ChatGPT

2026年7月10日 08:54
GPT-5.6全量放送,Codex正式併入ChatGPT

重點摘要

OpenAI正式推出GPT-5.6系列,主打更高性價比與速度,並同步將編碼代理Codex直接整合進ChatGPT,成為新的ChatGPT Work功能。根據早期用戶回饋,GPT-5.6 Sol在日常任務上表現可靠,但在極限攻堅上仍不如Claude Fable 5。這波模型更新也反映了業界轉向提供更便宜、更快速的AI服務趨勢。

站內 AI 整理稿

2026年7月9日,美國時間,OpenAI 終於正式全面推出 GPT-5.6 系列模型,同時也帶來了一個重大產品整合:程式碼工具 Codex 正式併入 ChatGPT,化身為全新的「ChatGPT Work」。這項更新不僅僅是在既有介面中增加一個入口,而是直接將 Codex 的能力完全融入 ChatGPT,就連 App 圖示也跟著更新,但用戶仍可選擇保留原圖示。早在 13 天前,OpenAI 在 GPT-5.6 Sol 限量預覽文件中,僅展示了編碼、生物、網路安全等重點評測,並承諾當模型更廣泛開放時將會公布更完整的評測結果。如今隨著全面上線,完整的評測成績單也一併公開。

不過,在官方數據出爐之前,許多獲得早期存取權限的用戶已經在社群平台上分享了第一手的實際體驗。歸納這些「民間評測」,最直接的結論是:GPT-5.6 Sol 在攻克極難題目上仍不如 Claude Fable 5,但它的性價比更高、更適合日常辦公使用。用戶普遍認為它相對便宜且速度飛快,這在實際工作中非常關鍵。**價格與速度:便宜、快速、高性價比**

OpenAI 在正式文件中開門見山地說明,GPT-5.6 的目標是「每個 token 帶來更多智慧、更強的每美元性能,以及在最困難任務上按需調用更高能力」。GPT-5.6 系列分為三個版本:Sol、Terra 和 Luna。API 定價按每 100 萬 token 計算:Sol 輸入 5 美元、輸出 30 美元;Terra 輸入 2.5 美元、輸出 15 美元;Luna 輸入 1 美元、輸出 6 美元。這個定價策略極為重要,因為它讓用戶更容易接受性能上的妥協。許多拿來與 Claude Fable 5 比較的人發現,GPT-5.

6 Sol 的 API 單價明顯更低:輸入價格僅為 Fable 5 的一半,輸出低 40%。此外,GPT-5.6 支援更可預測的 prompt caching,快取讀取還可享 90% 折扣,進一步降低長上下文任務的實際成本。速度方面是另一大亮點。官方指出 Sol 版本最高可達每秒 750 個 token,換算成中文大約是每秒 500 到 700 個漢字。這項特性大幅壓縮了模型思考與生成的時間,普通聊天時能帶來極為明顯的「秒回感」。**評測成績:低成本完成更多任務**

在 Agents’ Last Exam 這項測試長時間專業工作流的評估中,GPT-5.6 Sol 拿到 53.6 分,比 Fable 5 高出 13.1 分;即使只開啟 medium reasoning,也能以約四分之一估算成本超越 Fable 5。OpenAI 還指出,Terra 和 Luna 可以在大約十六分之一的成本下超過 Fable 5。官方 Benchmark 雖不等於最終結論,但清楚展現了 OpenAI 這次的敘事重點:不只比誰更強,更比誰能以更低成本完成更多任務。在第三方評測平台 Artificial Analysis 的綜合測試中,GPT-5.

6 完成任務時消耗的 token 明顯更少,尤其是推理 token 數量極低,就單位 token 產出與運行速度而言效率極高。**ChatGPT Work:Codex 正式併入,打造通用辦公 Agent**

除了模型本身,OpenAI 還舉辦了一場直播詳細介紹所有更新。在直播中,ChatGPT Work 的重要性絲毫不亞於 GPT-5.6,甚至 OpenAI 執行長 Sam Altman 直言這是「really big deal」。某種意義上,GPT-5.6 反而像是專門為 ChatGPT Work 服務的模型底座。ChatGPT Work 本質上是把 Codex 放進了 ChatGPT。直播畫面中呈現的介面與 Codex 過去的工作模式非常相似。

OpenAI 說明,ChatGPT Work 是 ChatGPT 裡的一個 Agent,可以跨應用程式和檔案採取行動,必要時陪伴一個專案工作數小時,並從目標一路做到完成品。值得注意的是,OpenAI 並不是單純將 Codex 改名。Codex app 會併入新的 ChatGPT desktop app,Codex 仍然是面向開發者與技術人員的強大編碼 Agent,但它將與 Chat 和 Work 共同出現在同一個桌面應用程式中。

也就是說,Codex 的能力被拆成了兩個部分:Codex 入口繼續存在,負責程式碼、倉庫、PR、diff、review 等純工程任務;而 Codex 背後「接任務、讀上下文、呼叫工具、分步驟執行、交付結果」的通用能力則被抽出來放進 ChatGPT Work。這使得 ChatGPT 現在擁有三個主要入口:Chat(對話)、Codex(編碼)、Work(通用辦公)。**用戶實際體驗:更適合日常,可靠且高效**

許多獲得早期存取權限的網友分享了使用心得。整體來說,GPT-5.6 Sol 的優勢不在極限攻堅,許多人認為它在性能上仍與 Fable 5 有一段距離,但在日常工作上贏得了信任。用戶願意每天開著它,將大量日常任務、細節檢查、上下文判斷和中間過程交給它。有網友比喻,Sol 像一個有魅力、高效、有才華、讓人羨慕的同事;Fable 則像一個有點擰巴的天才,在自己執著的問題上極其出色,但不太適合日常相處。在他的體驗中,Fable 仍然適合目標極其明確的任務,如定向除錯、安全問題和性能優化,因為這類任務有清晰的獎勵函數,模型可以不斷往一個確定目標推進。

但一旦回到日常協作,Sol 的優勢便展現出來:更順手、更會配合、更適合長時間協作。因此更好的策略或許是讓 Fable 出謀劃策,再拿 Sol 去執行。另一位團隊使用者指出,自己的團隊在使用模型上一向保守,但 GPT-5.6 對團隊產生了巨大影響:他們現在消耗的 token 數量是過去的 5 倍。這並非抱怨,而是因為團隊更願意使用模型。雖然多出的 token 並沒有帶來 5 倍的生產力提升,但多出來的運算主要用於提高既有工作的品質:反覆檢查每一個細小決策、處理邊緣情況、補上容易忽略的打磨環節。在程式碼能力上,Vercel 的 Next.

js 技術負責人兼共同作者 Tim Neutkens 也給予正面評價。他們測試 Sol 已超過兩個月,在 Next.js 專案的日常工作中,Sol 表現出色,能夠理解架構取捨、調查複雜專案、在修 bug 時考慮程式碼庫其他部分,而且幾乎不需要太多指導。Sol 已經參與了一些 Next.js 伺服器的大型重構,團隊只需指出高層次改進方向,Sol 就能端到端實現。但也有早期用戶給出較為降溫的評價,認為 GPT-5.6 Sol 並不像 Fable 那樣代表一次巨大的變化或全新架構,更像是在 GPT-5.5 基礎上充分打磨出的升級版。考慮到這次更新耗時約三個月,甚至很難說有什麼了不起。

不過考量到價格相同(Sol 與 5.5 同價)且能力提升,GPT-5.6 Sol 依然是訂閱制下能用到的最好模型。有消息透露,GPT-5.6 將是 5.x 系列中的最後一批模型,預期 GPT-6 可能在本月稍晚或下個月發布。**市場趨勢:便宜模型批量放送,兩條路線競爭**

儘管 GPT-5.6 並非「前沿模型重大躍遷」,但對於 Agent 應用而言,性價比極其重要。Agent 需要大量讀取上下文與執行任務,token 消耗難以計量。因此問題不只是「誰最聰明」,還包括「誰足夠聰明、足夠快、且能被大量調用」。GPT-5.6 的三個版本分工明確:複雜任務交給 Sol,日常任務交給 Terra,高頻輕量任務交給 Luna。同一時間,xAI 發布了 Grok 4.5,Meta 推出 Muse Spark 1.1,主打都是便宜、快速、高性價比。按每 100 萬 token 計費,Grok 4.

5 輸入 2 美元、輸出 6 美元,且具備約 2 倍的 token 利用率;Muse Spark 1.1 更低,輸入 1.25 美元、輸出 4.25 美元。這代表前沿模型競爭正從「跑車馬力競賽」轉向「商用車市場」:用戶不僅關心跑得快不快,更關心省不省油、耐不耐用。而 Anthropic 則選擇了另一條路。它持續強化工作流,但更強調協作品質與人的判斷。例如剛推出的「Reflect with Claude」功能,讓用戶回看過去 1、3、6、12 個月如何使用 Claude,分析常見任務與使用模式,提醒用戶思考哪些事適合交給 AI,哪些仍應自己完成。

OpenAI 的工作流強調規模化調用,Anthropic 則更強調高品質協作。兩者路線不同,但目前擁有最頂級模型的 Anthropic 在估值與市場信號上似乎更勝一籌。值得注意的是,Anthropic 顯然感受到 OpenAI 此次更新的壓力。除了將 Fable 5 的使用限制延長到 7 月 12 日,它更在凌晨為所有用戶重置了限額。競爭之下,雙方都在積極回應市場需求。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

6 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

7 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

11 分鐘前