智東西生成式AI

OpenAI公佈GPT-5.6自進化秘籍!翁荔被曝迴歸

2026年7月30日 02:13

重點摘要

OpenAI公布GPT-5.6 Sol自我優化進展,透過優化GPU內核與推測解碼技術,使推理服務成本降低20%、Token生成效率提升15%。此外,剛離職的AI專家翁荔被傳將回歸OpenAI,協助AI自進化研究。GPT-5.6 Sol在二維解謎評測中因API配置問題表現不佳,調整後得分提升3倍,輸出Token消耗量縮減至原先的六分之一。

站內 AI 整理稿

OpenAI 於今日凌晨一次釋出四項重大消息,涵蓋模型自我優化技術、關鍵人才動向、硬體研發進展與用戶規模里程碑。其中,最新旗艦模型 GPT‑5.6 Sol 已開始自主優化生產環境中的 GPU 核心程式,成功將推理服務部署成本降低 20%,同時透過改進推測解碼技術,使整體 Token 生成效率提升超過 15%。此外,剛離職並創辦美國 AI 獨角獸 Thinking Machines Lab 的翁荔(Lilian Weng)傳出將重返 OpenAI,協助公司推進 AI 自進化研究。

OpenAI 總裁 Greg Brockman 則透露,公司正在打造一款 AI 硬體,且「用戶可能很快見到」,他認為在多數情況下,人們會選擇與電腦進行對話。在產品規模方面,OpenAI 用戶數首次突破 10 億人,服務企業達 200 萬家。GPT‑5.6 系列模型於本月初正式發布,旗艦版本 GPT‑5.6 Sol 在 Artificial Analysis 的編程智能體評測榜上表現優於 Claude Fable 5,調用成本約為後者的三分之二;均衡模型 Terra 在智能基準測試中對標 GPT‑5.

5,費用僅為一半;快速且經濟的 Luna 則是該系列中響應最快、性價比最高的模型,定價較 Sol 降低八成。這些成果背後,OpenAI 從兩大技術棧進行改革:一是推理服務體系,透過優化負載均衡、推測解碼、緩存機制與內核算子;二是智能體調度基座,針對上下文膨脹、工具調用邏輯與重複計算冗餘進行改善。在負載均衡方面,GPT‑5.6 Sol 透過 Codex 平台分析全球真實業務流量,能自動定位算力失衡問題,測試新的路由策略,並迭代調度規則。研究人員已訓練 GPT‑5.6 使其能在 Triton 與 Gluon 兩種開源 GPU 編程語言中編寫及優化核心代碼,這些代碼負責執行構成模型的數學運算。

該自主優化最終讓端到端推理服務成本降低 20%。另一項關鍵技術是推測解碼,系統同步部署一個較小的預測模型與主模型協同運作:草稿模型先行預測一串 Token,再由主模型並行校驗。GPT‑5.6 Sol 能針對預測模型進行數百組架構對比實驗,並自主啟動訓練任務,遇到硬體故障或訓練震盪時自動介入,使整體 Token 生成效率提升 15% 以上。此外,模型處理未緩存的輸入 Token 時,會透過高算力消耗構建 KV 緩存,後續生成階段反覆讀取並擴充。以往因配置參數空間龐大,研發人員只能依賴通用經驗規則。如今 GPT‑5.

6 Sol 能解析真實線上負載,生成並比對各類備選配置,針對不同場景完成精細化超參優化,形成一套可持續運轉的閉環反饋系統。在智能體調度基座方面,ChatGPT Work 與 Codex 依賴連續的模型調用與工具調用鏈路完成複雜任務。研究人員指出,若一項任務需發起 30 次模型調用,每次多一秒延遲,累積損耗就很可觀。為此,OpenAI 採用三大手段:管控上下文膨脹、優化工具加載機制、複用已有計算成果。

具體做法包括延遲加載檢索,僅在工具被實際調用時才載入上下文;預設限制工具返回輸出內容在 10,000 Token 以內;並將模型可見的全部歷史數據設為「僅追加寫入」模式,避免前文被修改,確保提示緩存的前綴穩定保留。值得注意的是,GPT‑5.6 Sol 雖然已攻克圈複覆蓋猜想等數學難題,但在二維解謎評測基準 ARC-AGI-3 中正確率僅 7.8%,上一代 GPT‑5.5 更只有 0.4%。OpenAI 研究發現,這並非模型本身的缺陷,而是智能體調度框架的參數配置所致。

該框架在模型每執行一次操作後,會清空所有私有推理思考過程,導致模型無法留存上一輪的推演思路;同時採用滾動截斷窗口機制,隨著交互歷史累積,早期操作記錄被自動剔除。當研究人員啟用 ChatGPT 與 Codex 內部默認的兩項 API 配置——推理記憶留存與上下文壓縮後,模型在公開測試集上的得分直接提升 3 倍,輸出 Token 消耗量縮減至原來的六分之一。具體來說,OpenAI 基於 Responses API 重構了 ARC-AGI-3 的調度框架,讓模型只需傳入上一輪應答 ID,即可在多輪交互中完整保留推理過程。

開啟推理內容持久留存後,模型每一步操作前的推演耗時明顯下降,且能隨任務進程不斷習得解題規律。同時,用上下文壓縮機制取代原有的滾動截斷,使模型在更長的解謎流程中留存各謎題的習得經驗,最終以更少的輸出 Token 獲得更高分數。OpenAI 建議 API 開發者採用與產品相同的設置,或在比較不同模型時選擇使用這些設置的評估結果。伴隨模型性能、核心人才與用戶體量的全線突破,OpenAI 在此次發布中展現了大模型競爭已邁入全棧工程化比拼階段。從算子內核優化到底層技術架構升級,GPT‑5.6 系列所實現的效率提升,源於多年來在算法、推理、智能體調度等技術體系上的層層迭代。

OpenAI 認為,隨著模型本身承載並落地大量優化方案,後續的迭代速度將持續加快,而提供低成本、高效率、可規模化的產業落地能力,將成為降低 AI 應用門檻、促進大規模落地的關鍵。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

30 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前