GPT-6 Sol和Luna上線,打折比梁文鋒還狠

字母AI2026.09.23 11:08 · 來自北京全文5453字00:00 / 14:27Opus 5.5發佈90分鐘,OpenAI來打價格戰了。文 | 字母AI今夜註定無眠。Opus 5.5剛剛發佈90分鐘,OpenAI就把GPT-6 Sol和Luna一起端了上來。前腳Anthropic剛把Opus的價格砍了一刀,後腳OpenAI直接把刀砍得更深。GPT-6 Sol每百萬Token輸入只要2美元、輸出10美元,價格正好只有Opus 5.5的一半,Astra的五分之一。Luna更誇張,只要0.1美元和0.5美元,直接砍到Astra的1%。
這一晚上,模型能力還沒來得及被檢驗,價格戰先打起來了。便宜,但沒縮水Astra仍然是GPT-6系列的最高檔,OpenAI明確表示,如果任務足夠重要、足夠困難,而且不想在能力上做任何妥協,繼續選Astra。新來的Sol和Luna的任務,是把Astra的能力往更便宜的模型裡塞。OpenAI表示,兩款模型採用了與Astra相似的訓練方法,把這一代在專業工作、事實準確性、Coding、Computer Use和Alignment上的進步給“下放”了。其中,GPT-6 Sol的定位為複雜Coding和Agent工作流的主力模型,Luna則負責高頻、大規模、任務相對集中的工作,核心就是快和便宜。
兩款模型都是105萬Token上下文、最大128K Token輸出,和Astra處於同一檔;都支持文本和圖片輸入,網頁搜索、文件搜索、代碼解釋器、Computer Use、MCP、Skills等工具也都可以正常調用。它倆的推理檔位甚至比Astra多一個選項。Astra只有low、medium、high、xhigh和max,Sol和Luna則多了一個none,可以把推理關掉。默認檔位均為medium。Sol的知識截止日期是2026年4月20日,Luna反而更新一些,到2026年5月18日。有意思的是,Astra的知識截止日期是2026年4月30日,卡在兩個新模型中間。
看來知識截止日期和模型“檔位高低”並不是一回事。然後再看價格。GPT-6 Sol每百萬Token輸入2美元、輸出10美元,緩存輸入只要0.2美元;GPT-6 Luna更狠,每百萬Token輸入0.1美元,輸出0.5美元,緩存讀取甚至低到了0.01美元。而且這還不是價格的下限。Batch和Flex模式繼續半價,緩存命中的輸入Token也只按照普通輸入價格的10%收費。不過,百萬上下文不能從頭到尾都按這個價格算。OpenAI規定,一旦單次請求的輸入超過27.2萬Token,整個請求都會按照長上下文價格收費:輸入和緩存價格翻倍,輸出提高50%。
所以Sol塞進超長上下文以後,會變成4美元輸入、15美元輸出;Luna則變成0.2美元和0.75美元。105萬上下文是真的,0.1美元也是真的,但兩個數字不能直接乘起來。價格降得很誇張,但性能並沒有擺爛。OpenAI用Sol證明了,原本需要旗艦模型花很多錢才能做的事,現在可以便宜很多。比如跨應用Agent測試AutomationBench——由於OpenAI的文檔裡不包含剛發佈的Opus 5.5,所以我們去找了Zapier的公開榜單。在這項測試裡,GPT-6 Sol開到xhigh拿到33.2%,單任務成本只有0.27美元。如果只看絕對能力,它還打不過剛發佈的Opus 5.
5,後者max檔做到40.0%,僅次於Astra max的41.4%。但Opus 5.5每項任務要1.28美元,幾乎是Sol的4.7倍;Astra則要1.73美元,是Sol的6.4倍。雖然Sol沒有拿下第一,但它用不到0.3美元的價格,已經擠進了同一張前沿Agent榜單。Coding也是一樣。在真實代碼庫軟件工程測試DeepSWE v1.1裡,GPT-6 Sol max拿到68.8%,距離Fable 5此前最高的69.9%只差1.1個百分點,但OpenAI估算單任務成本低約80%。Luna則更加誇張,這個每百萬輸入Token只賣0.1美元的模型,max檔也跑到了66.6%的水平。
OpenAI稱,這已經接近Opus 5和Fable 5的medium檔,但單任務成本分別低了93%和96%。在測試Computer Use的OSWorld 2.0上,Sol xhigh拿到了60.5%,和Opus 5 medium的60.3%基本打平,成本卻降了大約80%;Luna開到max,也能超過上一代GPT-5.6 Sol medium,而成本只有後者的大約十分之一。不過需要說明的是,雖然Anthropic當天公佈的Opus 5.5成績高達81.8%,但這組成績來自Anthropic自己的OSWorld 2.0評測設置;OpenAI公佈的60.
5%,則是在2026年8月8日版本的離線任務集上,按照部分完成度得分統計出來的。兩邊並不是同一套公開橫測,不能直接比較。要看Sol和Opus 5.5誰的Computer Use更強,得等同一套第三方測試。GPT-6 Sol和Luna今天已經進入ChatGPT Work和Codex,Plus、Pro、Business、Enterprise和Edu用戶都可以使用;Free和Go用戶也可以在桌面App裡使用GPT-6 Luna。開發者則可以直接通過API調用,模型ID分別是gpt-6-sol和gpt-6-luna。目前兩款模型還沒有進入普通Chat。
Work和Codex則會在當天逐步完成推送,如果現在還沒看到,可能只是還沒輪到。熟悉的Tibo重置,同樣也沒有缺席。新模型、永久降價,再送一次額度重置,這個發佈夜算是把“便宜”貫徹到底了。跑分沒暴漲,但體感在變把視角移到第三方Artificial Analysis,這代模型的智力其實和上一代沒什麼差別。在最新的Intelligence Index裡,GPT-6 Sol max拿到48分,上一代GPT-5.6 Sol是47分;GPT-6 Luna max則是37分,上一代GPT-5.6 Luna甚至還高一分。兩款模型的綜合能力基本原地踏步,但成本就完全不是這一回事了。
Artificial Analysis測得,Sol max的平均單任務成本從上一代的1.99美元降到了1.06美元;Luna則從0.18美元降到0.07美元。這甚至不是因為兩個新模型學會了“省Token”,Sol平均每項任務生成的Token從2.9萬增加到了3.1萬,Luna更是從4.1萬增加到5.1萬。它們就是單純賣得更便宜了。說到便宜,怎麼能不提中國模型呢?最新的DeepSeek V4.1 Flash在Artificial Analysis Intelligence Index裡拿到39分,平均單任務成本大約0.27美元。雖然成績比Luna高兩分,但Luna的單任務成本只有0.
07美元,差不多是V4 Flash的四分之一。但要說它是“價格屠夫”,還是差點意思——就在昨天,小米剛剛發佈了MiMo-V2.6系列。其中MiMo-V2.6-Pro在同一版Artificial Analysis Intelligence Index裡拿到46分,距離Sol max的48分只差2分;但它的平均單任務成本只有0.13美元,而Sol是1.06美元。只看API價格的話,MiMo-V2.6-Pro每百萬Token輸入0.435美元、輸出0.87美元;更低一檔的MiMo-V2.6-Flash,則只要0.14美元輸入、0.28美元輸出。
可惜目前Artificial Analysis還沒有給MiMo-V2.6-Flash完整的綜合指數,所以暫時沒法和Luna做完全同口徑的性價比比較。這場價格戰,遠遠不只是OpenAI和Anthropic兩家公司之間的事。OpenAI把GPT-6的價格打進來了,但中國模型早就在這裡捲了很久。說完價格和跑分,值得注意的是,OpenAI這次也專門對模型的“回覆風格”做出了調整。官方專門給Sol和Luna列了一項“協作模式”,它們繼承了Astra在溝通方式上的改進:說話更清楚,少一點行話,減少奇怪的措辭和低價值細節,整體回答也會稍微變短,但不犧牲真正有用的信息。
OpenAI認為,這種變化在Coding和技術對話裡尤其明顯。而就在90分鐘前發佈的Opus 5.5,也做了幾乎同一個方向的升級。Anthropic說,新Opus會把重要信息更早放出來,減少行話和一些Claude特有的奇怪表達,更遵守用戶規定的寫作方式。同一個晚上,OpenAI和Anthropic都開始給自己的模型“去AI味”了。另一個非常直接的升級,是降低了模型的事實性錯誤——說實話,這讓我有一種夢迴去年的感覺。前沿大模型已經很少再把“不胡說八道”當成賣點了。雖然它依然重要,但相比Coding、Agent、Computer Use這些新能力,總顯得不夠“前沿”。
Sol和Luna這次又把它撈了回來,可能是因為對於這種主打低價、大規模部署的模型來說,把最基礎的能力做好才是關鍵。OpenAI用一批真實ChatGPT對話做測試,這些對話都曾被用戶標記出事實錯誤。結果GPT-6 Sol犯下的事實錯誤數量相比GPT-5.6 Sol減少了大約一半,已經開始接近Astra。Luna也明顯進步。在較高effort下,它的事實準確性可以達到GPT-5.6 Sol附近,而成本大約只有後者的百分之一。當然,OpenAI自己也提醒,這批樣本本來就是專門挑出來的“容易讓模型犯錯”的對話,並不能代表日常使用中的實際幻覺率。
模型市場只剩兩種贏法把過去48小時的模型發佈連起來,會發現一件有點殘酷的事:現在發一個“挺強的模型”,已經不太夠看了。模型越來越多,能讓用戶記住的理由卻越來越少,要麼把能力天花板繼續往上頂,要麼就在相近能力下,把價格壓到別人比不了的位置。Artificial Analysis借用了經濟學裡“帕累託前沿”的概念來表示競爭的兩個維度,更強、或者更便宜,一個模型至少得佔一樣。如果另一個模型在比你強的同時,還比你更便宜,那你的處境就麻煩了。昨天發佈的Grok 4.7,就是個很好的例子。它其實不算弱,Artificial Analysis給Grok 4.7 xhigh打了46分,比Grok 4.
6高2分;Coding Agent Index更是從47分跳到56分。xAI給它換了更大的基礎模型,把訓練重點放到長時間Coding和知識工作上。但同一天,MiMo-V2.6-Pro也上線了。同樣是46分,但Artificial Analysis測得Grok 4.7 xhigh跑一項Intelligence Index任務平均要3.74美元,而MiMo-V2.6-Pro只要0.13美元。後者還是開放權重模型,官方API每百萬Token輸入0.435美元、輸出0.87美元。當然,一張綜合榜並不能決定模型的最終表現。
Grok還有Grok Build、產品生態,以及具體Coding和Agent任務上的優勢。但事實就是,46分對46分,價格差近30倍。到這個程度,“別的優勢”已經很難再作為擺在桌上的籌碼了……用戶現在的選擇實在太多了,貴不是問題,但你的表現最好配得上這個價格。Anthropic今天發佈的Opus 5.5,走的就是這條路。Artificial Analysis給出的最高成績是58分,一下子把能力上限又往上推了一截。它當然不便宜,max檔跑一項任務平均要5.98美元,但至少用戶花這筆錢的時候,知道自己買的是目前的最強模型之一。
OpenAI則選了另外一條:GPT-6 Sol在Artificial Analysis只有48分,距離Opus 5.5還有明顯差距;Luna更只有37分。但Sol一項任務平均只要1.06美元,Luna更低到0.07美元。這個價格,它們壓根不需要證明自己比Opus更聰明,只要夠用就行。短短48小時,新模型幾乎自動站成了兩排。一邊是Opus 5.5這種繼續衝能力上限的模型;另一邊是Sol、Luna和MiMo-V2.6這些不斷往下砸成本的模型。模型市場正在被兩股力量同時往外拉,一邊不斷抬高性能,另一邊不斷壓低價格。中間那片“還不錯”的位置,只會越來越難待下去。
或者,乾脆換個思路,別卷模型了,去做應用吧?Meta就是最現成的例子。Muse上線後迅速登頂美國App Store,9月21日Meta股價單日大漲11.4%;路透社統計,Muse上線至今,Meta股價已經累計上漲超過20%,市值增加約2000億美元。模型卷不到第一也沒關係,做個爆款應用,華爾街照樣買單。
Related
相關文章

華為大模型雙子星聯手造物理基模,剛融資數億元
機器人前瞻(公眾號:robot_pro) 作者 | 許麗思 編輯 | 漠影 智東西9月23日報道,近日,物理AI公司息壤開物(XIRRA)已在兩個月內連續完成數億元種子輪及天使輪融資,由敦鴻資產領投,華控基金、三花控股、銀杏谷資本、澤然資本、本堅基金、上海天使會、標樸投資等知名機構跟投。 這家公司由兩位華為大模型核心人物聯手創辦:創始人、CEO李寅曾任華為雲大模型CTO,擁有萬卡級模型訓練及豐富的產業落地經驗;聯合創始人、首席科學家張含望是南洋理工大學教授,長期從事因果機器學習與多模態智能研究。 兩人選擇了一條技術門檻極高的路線:從底層研發原生物理基礎模型(Large Physics Model,LPM),希望通過一套通用底座,將物理智能能力推廣機器人、自動駕駛等不同產業場景,乃至科學計算領域。 這一技術路線已取得階段性成果。在9月16日公佈的WorldArena 2.0全球總決賽榜單中,息壤開物在Track 1視頻質量賽道取得軌跡精度全球第一、物理合規性全球前三的成績。 為什麼一家初創公司,要從底層重新研發一套物理基礎模型? 回看數字AI的發展,在GPT等大語言模型出現之前,自然語言處理(NLP)領域高度依賴單場景定製,不同客戶、不同任務,往往需要單獨開發模型。直到大語言模型出現,越來越多的企業開始基於統一底座開發應用,推動AI1.0時代到來。 如今,AI正加速走向真實物理世界,具身智能融資與產品演示持續升溫,規模化商業落地卻仍面臨挑戰。 機器人換一種物料、換一個工位,往往又要重新採集數據、訓練模型和工程適配。高昂的定製化成本,讓機器人能力難以快速複製到更多場景。 AI 2.0時代,能否也出現一套通用基礎模型,讓機器人具備跨任務、跨本體、跨場景的泛化能力,讓更多行業客戶低成本開發自己的具身大腦? 這正是息壤開物希望探索的問題。該公司本輪募集資金將主要用於原生物理AI模型的

Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token?
Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token? 本文作者: 鄭佳美 2026-09-23 12:10 導語:先壓低判斷成本,再用 Calibration 提升可靠性,最終借 Agent 放大調用量。 先壓低判斷成本,再用 Calibration 提升可靠性,最終借 Agent 放大調用量。 作者丨鄭佳美 編輯丨岑 峰 昨天,大家還在驚歎 Jev 的速度和低成本,今天它又做了一件更誇張的事:給申請到的用戶直接發放 1.2 億 Token 額度。消息出來以後,大家沒有先覺得賺到了,更多冒出的念頭反而是:這不對勁。因為 Jev 本身就極其省 Token。它主要處理分類、路由、評分和概率判斷,不需要像通用大模型那樣生成大段內容,一條短文本輸入可能只有幾十個 Token。按照這種消耗方式,1.2 億 Token 足夠普通應用跑幾百萬次判斷,在輸入足夠短的情況下,調用規模甚至還能繼續往上走。問題也就來了:一個已經靠低價獲得大量討論的模型,為什麼還要繼續往外送這麼大的額度?答案可能藏在 Jev 想做的那門生意裡。它要賣的從來都不是一段生成內容,而是一次判斷,而 1.2 億 Token 正在把這種判斷推向一個過去很少出現的狀態——便宜到開發者幾乎不用考慮次數。011.2 億 Token 到底意味著什麼?從技術上看,這相當於給一個應用塞進了數百萬次低成本決策機會。雷峰網傳統大模型通常圍繞一項完整任務工作,讀入上下文、完成推理、生成結果,一次調用本身就比較重。Jev 的任務顆粒度小得多,它可以只回答一個問題:這段內容屬於哪一類,這幾個工具該選哪一個,這個結果應該保留還是丟棄,當前任務應該繼續還是結束。這意味著 Jev 的 Token 消耗方式天然適合高頻調用。一個 Agent 跑完整條任務鏈,可以在用戶意圖識別、工具選擇、結果篩選、異常處理和狀態檢查等多個位置調

豆包做手機、阿里造平板:AI開始爭奪硬件控制權
識礁Farsight2026.09.23 11:43 · 來自北京全文3182字00:00 / 09:20大廠為何突然集體“變硬”?文 | 識礁Farsight繼豆包推出“第二代豆包手機”後,阿里也開始“變硬”。2026年9月22日,阿里召開2026雲棲大會,展示了仍在研發中的“千問平板”QwenBook。據《晚點LatePost》報道,QwenBook由阿里雲旗下無影團隊打造,定位原生智能體電腦,產品定義和硬件部分由團隊自研。無影過去做雲電腦積累的系統和端雲能力,將融入其中。

螞蟻密算韋韜:企業AI進不了生產,卡點不在模型
TechPulse2026.09.23 11:40 · 來自浙江全文1839字00:00 / 05:57韋韜提到,用自然語言描述不許做什麼這類紅線時,大語言模型的違背率超過80%。企業AI的下一道門檻,落在了一個比模型能力更難工程化的問題上。

韶音首款 AI 耳機 OpenFit 2 AI 亮相雲棲大會,重磅首發“AI 實驗室”四大新功能
作為開放式耳機領域的領頭羊,Shokz 韶音首次重磅參展,不僅攜旗下首款 AI 耳機 OpenFit2AI 核心亮相,更在現場聯合光帆科技首發了“AI 實驗室”全新功能,全面展現了 Qwen 大模型在音頻可穿戴設備中的深度產業落地。作為韶音佈局智能音頻賽道的開山之作,OpenFit2AI 深度融合了通義千問(Qwen)大模型的強大能力,集長時錄音、AI 會議紀要生成與多語種實時翻譯於一體。

Claude Code v2.1. 280 落地:Opus 5. 5 正式接棒默認王座,百萬上下文配 4 美元骨折價把賬單壓進地心
最新推送的Claude Code v2.1.280版本里,Claude Opus5.5(claude-opus-5-5)正式被任命為默認Opus模型,這也讓前陣子開發者圈裡流傳的"跳級突襲"傳聞徹底塵埃落定。這枚新旗艦一口氣吞下100萬Token的上下文窗口,定價牌掛得異常兇悍:每百萬Token輸入4美元、輸出20美元,緩存讀取更是壓到每百萬Token0.