GPT-6 Sol 降價 50% 的秘密:消失的 Terra,一場模型梯隊平移

2026年9月23日 20:47
GPT-6 Sol 降價 50% 的秘密:消失的 Terra,一場模型梯隊平移
站內 AI 整理稿

本文作者: 高允毅 2026-09-23 20:47 導語:奧聖上臺,梁聖危機了麼?奧聖上臺,梁聖危機了麼?作者丨高允毅 編輯丨岑 峰 OpenAI 也走性價比路線了?別被它的“偷樑換柱”給騙了。今早,硅谷又熱鬧了,迎來雙雄對決。Anthropic 推出 Claude Opus 5.5,OpenAI 緊接著推出 GPT-6 Sol 與 Luna。和以往模型更新不同的是,行業的討論點聚焦到了“大家怎麼都變便宜了”。Claude Opus 5.5 較上一代 Opus 5,成本降低 40% ,擁有 Fable 級性能。而 GPT-6 Sol 降得更狠,性能持平 GPT-5.

6 Sol,價格直接腰斬,每百萬 Token,輸入 2 美元,輸出 10 美元,性價比看似要一步踩進 DeepSeek 的腹地。但如果仔細對照,就會發現 OpenAI 所謂腰斬,是抹掉了一個型號 Terra。我們都知道,OpenAI之前的模型檔位是:旗艦 Sol、中端 Terra、輕量 Luna。現在變成了 Astra、Sol、 Luna。Terra 哪去了?網友戲稱變成 Sol了,把整個梯隊往上提了一格。再重新對比一下 GPT-5.6 Terra,每百萬 Token 輸入 2 美元、輸出 12 美元,和 GPT-6 Sol 對照看,幾乎沒什麼變化。這波降價潮的真相,也就不言自明瞭。

01三家賬本攤開看,誰在真降價?當下AI賽道價格戰白熱化,各大廠商紛紛下調模型定價,但降價的成色、邏輯和含金量天差地別。Anthropic 降價最有誠意,DeepSeek 仍有絕對的成本優勢,但差距在縮小,OpenAI 更像是商業定價敘事為主,工程優化為輔的策略型降價。先說 Anthropic。Anthropic 走的是“強模型,真降價”。Claude Fable 5.1 本來定位就是模型天花板,專攻高價值複雜推理場景。而 Claude Opus 5.5在大多數日常任務,性能與之相當,僅在極深度邏輯推導、超大規模代碼工程等高難度場景存在差距。相當於用 40% 價格保留 80% 核心能力。

Claude Opus 5.5真正厲害的是,它解決了長任務裡最燒錢的隱形開銷——思維鏈。在大廠的不少工作場景中,像處理長文檔分析、多輪工具調用等任務,會讓模型會在自我糾錯和深度推導中燒掉預算。Opus 5.5 不只把基礎價格降了,更將核心的‘緩存讀取’費用降了 60%。這樣一來,長任務裡“深度思考”的總成本少了近六成,開發者敢頻繁調用高階推理了。而 DeepSeek 的絕對成本優勢仍在。在閒時,還能減半。如果把 DeepSeek 與 OpenAI 的中端模型進行對比的話,可以看出 OpenAI 已經在努力向DeepSeek靠攏了。

再看輕量級戰場,不少人會困惑,似乎賬面上看,OpenAI 好像是更便宜的那個。單看高峰時段標價,DeepSeek-V4.1-Flash 的輸入費是 GPT-6 Luna 的 1.5 到 3 倍,輸出費是 1.2 到 2.4 倍。不過這兩者在性能和體量是不能放一起比較的。GPT-6 Luna 是一個真正意義上的“小模型”,體積可能只有十幾 B 參數,專門用來處理極其簡單的短文本過濾、分類。DeepSeek-V4.1-Flash 表面上叫 Flash,但它的底層是一個總參數高達 552B 的重型混合專家模型,它在編程、長文本推理、多步邏輯上的智商,相當於前沿的中端大模型。

在這樣的智商碾壓下,它只比 Luna 貴一點點,這本身就是技術上的奇蹟。DeepSeek 之所以敢把一個 552B 的模型賣到三毛錢,完全是靠它的非對稱因果編解碼(CED)架構,只激活了 16B 的專家參數,算力損耗極低,且調用量越大、調度優化越充分,成本優勢越明顯。不過,DeepSeek 的低價有自己的“特殊門檻”,受制於錯峰機制,還高度依賴高前綴重複度。而 Luna 的低價沒有門檻,這種“省心價”對中小開發者而言反倒成了感知上的優勢。相較而言,OpenAI 更像是用“商業套路”、長文本加價和緩存命中折扣,實現了價格跳水。GPT-6 Sol 的 “價格腰斬”,本質是一次非常高明的定價敘事。

而隱藏在低價背後的兩大規則設計,才是OpenAI真正的佈局。一方面,它還把緩存命中輸入價格直接給到1折,每百萬Token價格是 0.20美元。從工程落地的角度看,這是一個高明的生態策略。對於大廠的複雜長程 Agent 任務,其系統前綴 Prompt 往往非常龐大。開發者一旦為了享受這 1 折優惠,把海量的企業基礎數據固定掛載在 OpenAI 的緩存裡,企業的遷移成本就會高到無法承受。這就像用便宜價格建了一道很難翻出去的牆。另一方面,GPT-6系列在長本文上全量加價,只要輸入超過 272K Token,整筆請求的輸入費直接翻倍,輸出費也漲 1.5 倍,本質是用價格槓桿調節需求。

這也暴露了OpenAI 在長文本上效率不夠,它缺少更強的壓縮技術,只能靠漲價限制高消耗場景。02降價背後,DeepSeek 和 OpenAI 的不同在降本這條路上,DeepSeek 和 OpenAI 走了兩條完全不同的路。DeepSeek 最早靠 V2 的 MoE 思路出圈,專家不一定要大,可以拆小,按需激活。這樣哪怕總參數很大,每次推理可以只跑一小部分。在最新的 DeepSeek-V4.1-Flash 中,這套激活思路到了登峰造極的境界,它的因果編解碼架構(CED),預填充和解碼用不同模塊非對稱激活,讓實際激活參數量不過 8B 到 16B 左右。

Kimi 大神蘇劍林曾點透其中的邏輯,大模型讀取提示詞時,只有最後一個 Token 用來預測下一個詞,前面的內容主要用來生成 KV 緩存。傳統模型裡,前面的 Token 雖然不用算輸出頭,但最後一層 MLP 依然會完整計算,省的算力微乎其微;而 DeepSeek 用 YOCO “只緩存一次” 的思路,讓預填充階段只負責生成全局緩存,生成完就停止,後續解碼階段直接複用,把原本不起眼的邊角優化放大成了核心成本優勢。而在 KV 緩存壓縮這件事上,DeepSeek 在迭代過程中把體積壓到了極致。

早在 V2 版本,DeepSeek 就提出 MLA 多頭潛在注意力,實現了 KV 緩存的低秩壓縮,相當於把完整的緩存拆成內容與位置兩部分分別精簡存儲。到 V4 版本,這套思路進化為壓縮稀疏注意力,疊加稀疏編碼、全局摘要、低精度存儲多重優化,把 KV 緩存降到了每 Token 約 3560 字節。到了 V4 版本,這套思路進化為壓縮稀疏注意力。在壓縮的基礎上,只存有效信息、用摘要代替全量數據、用更緊湊的精度格式存數據路等優化方式。把 KV 緩存的體積降到了每 Token 約 3560 字節。V4.

1 版本的第二代壓縮稀疏注意力(CSA2),則從三個維度再擠水分:一是不同網絡層之間共享中間特徵,不用每層都單獨存一份完整緩存,減少重複存儲;二是全量落地 FP4 極限精度存儲,進一步壓縮數據體積;三是搭配滑動窗口注意力的邊界重放機制,不用每次都從慢速存儲裡讀取完整緩存,只調用需要的片段即可。幾層技術疊加下來,全局 KV 緩存最終降到了每 Token 約 890 字節,體積僅相當於標準 Transformer 架構的 2% 左右。如果把標準 Transformer 的緩存比作一沓 A4 紙,那 DeepSeek 現在不僅把它壓縮成了一張便籤的大小,還把這張便籤反覆使用。

在萬卡級的大集群調度上,DeepSeek 直接把 GPU 的 “閒置時間” 和 “閒置空間” 幾乎榨乾,連主機內存、數據總線這些周邊硬件都被拉進算力流水線協同幹活,把整臺服務器的顯卡、內存、總線、網絡當成一整臺精密機器來擰效率。和 DeepSeek 的極客風格不同,GPT-6 Sol 走的是一條 “務實路線”,儘量不動核心模型架構,主要靠工程優化挖效率、用商業規則控成本。架構層面,它沒有跟進細粒度 MoE 拆分,這會打破它已經規模化、高穩定性的訓練計算圖體系。

OpenAI選擇的是更務實的參數蒸餾與稀疏化重構,把上一代模型裡部分冗餘的稠密層,拆分成更輕量的小 MoE 分支,不用動整體框架,就能大幅降低單 Token 推理的浮點運算量,進而減少一部分成本。面對長上下文場景的顯存壓力,OpenAI 選擇用階梯定價,避免超長文本。它把上下文的節點標註為272K,272K tokens 以內的上下文,靠成熟的類 PagedAttention 虛擬內存技術消化;超過的部分,請求會被強制調度到顯存更大的 B200 節點,計費直接翻倍。而這次大降價真正的核心,其實藏在 Prompt Caching(提示緩存) 的極致優化裡。

如果說 DeepSeek 降本的秘訣是把緩存做小,那麼 OpenAI 的核心策略就是把緩存用滿。為了把緩存的價值榨乾,OpenAI 一邊拼命提升緩存命中率,一邊努力延長緩存壽命。過去,當你把模型從“簡單模式”切換到“深度推理模式”時,之前算好的前綴緩存會直接作廢;而現在它支持動態調檔,舊緩存可以無縫跨模式反覆使用。OpenAI 還把緩存最短有效期拉長到 30 分鐘,只要命中緩存,輸入費用立馬打一折。它還開放了顯式緩存斷點功能,讓開發者可以自己決定哪部分內容進緩存,並配有專門的診斷工具來排查“為什麼沒命中”。最厲害的是它的預熱緩存能力。

用戶請求還沒發過來,系統就提前把固定的系統提示、工具定義、參考文檔的 KV 緩存算好等著。連圖片輸入、工具配置、結構化輸出格式這些內容,只要前綴完全一致就能命中緩存。這種優化效果直接反映在了賬單上。根據頭部 AI 團隊的實測,在 Copilot 交互式代碼場景裡,大批 Token 無需重複計算,需要重新處理的 Token 數量直接砍掉了一半以上;而在更吃資源的企業級 Agent,如 Manus 等團隊的實際落地中,原本 85% 的緩存命中率被硬生生拉高並穩定在 90% 以上。不僅如此,GPT-6底層重構了推理邏輯,支持工具響應等待期間並行處理其他任務,允許用戶中途調整需求。

這套靈活的多任務邏輯,本質都是為了延長高價前綴緩存的生命週期,最大化複用已有算力,減少重複消耗。03性價比內卷,奧聖上位過去兩年,大模型行業性價比敘事,一直屬於DeepSeek。梁文鋒用兩代架構把價格打穿地板,被人們直接封為了“梁聖”。OpenAI 這波降價後,網友開始調侃 “奧聖上位”。只是,這位新晉“奧聖”的上位成色,多少得打個問號。OpenAI講的性價比故事,一半靠換標,一半靠緩存摺扣,二者都建立在“用戶不細看價目表”的前提上。當巨頭的競爭開始比拼價格戰,既沒有萬卡集群也沒有自研架構的玩家,下一輪拿什麼上牌桌?

上車,(公眾號:)帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 GPT-6 Sol KV 緩存壓縮 OpenAI 獨家丨OpenAI的一款無屏硬件,正在深圳試製 OpenAI:為了不被殺死,Agent 竟學會了靠上下文「轉 ...周鴻禕:不會再投資新能源汽車,已經吃過一次虧;Op ...芯片從業者拆解OpenAI造芯,還能再快3個月?

高允毅 編輯 發私信 當月熱門文章 深度解讀:關於 Jev 的幾大疑問 GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?Anthropic 再定統一標準:MHS,打通 AI 與物理世界的統一接口 最新文章 深度解讀:關於 Jev 的幾大疑問 深度解讀:智譜為什麼要在 Infra 層搞 RSI?工作流可以自我進化了,英偉達開源 SoL-Pi,每小時省13.5刀!深度解讀 DeepSeek V4.

1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?熱門搜索 芯片 DeepMind app Windows GAIR AWS wifi 越獄 數據分析 掃地機器人 yahoo

Related

相關文章

AI改寫遊戲和內容行業,年輕人“抽卡”抽出新職業

AI批量生產內容之後,一些新崗位開始出現,比如遊戲行業的“AI視覺原型設計師”,影視行業的“AI導演”“AI抽卡師”。一天就要產出5到10張能進評審的原畫。確認了角色與場景後,接下來兩天,再用AI大模型生成出粗略的3D模型,看到效果。以上兩條,是當下遊戲公司盛趣遊戲對於美術應屆生提出的最新要求。

剛剛
鈦媒體生成式AI

殺豬盤最貴的一道工序,AI 接手了

硅谷Tech news2026.09.23 19:45 · 來自河南全文2595字00:00 / 06:51讓人心甘情願地把錢交出去。讓 AI 扮演一個虛構角色陪人聊天,已經是一個成型的商業門類。近期,這個門類裡也出現了另一類看起來並非合規的操作,從全球來看甚至有應用開發商用大模型搭起了 20 多款約會 App,用戶刷到的“匹配對象”裡 75% 不是真人。

剛剛
智東西生成式AI

213:1的Token懸殊背後,智能體正在改寫推理方式

芯東西(公眾號:aichip001) 作者 | 江宇 編輯 | 漠影 9月21日下午,北京中關村國際創新中心,開源推理框架SGLang核心貢獻者王書文放出一組數據:在Agent流量裡,一次請求的中位數輸入是8.8萬個Token,輸出卻只有413個Token,兩者相差213倍。

剛剛

​科大訊飛正式發佈 Spark-ASR-2.0,全面賦能硬件與開放生態

9月23日,科大訊飛官方正式發佈了全新一代語音識別大模型 Spark-ASR-2.0,標誌著其在語音交互與智能硬件落地方面邁出了關鍵一步。在具體的上線與落地節奏方面,該模型將於次日(9月24日)起在訊飛輸入法中逐步上線,同時通過訊飛開放平臺面向開發者與企業客戶全面提供 API 服務。

剛剛
量子位生成式AI

達卯科技完成新一輪融資,算電協同核心軟件層“稀缺標的”

達卯科技近期完成約2億元新一輪融資,該公司專注於算電協同AI能源運營作業系統,是賽道內少數已實現商業落地的軟體層企業。其核心產品算電協同2.0平台已具備GW級智算中心綠電直連的全週期營運能力,股東陣容包含寧德時代、商湯科技等龍頭。隨著算電協同獲國家政策支持並寫入政府工作報告,公司透過「技術賦能+營運落地」模式持續拓展市場。

剛剛