阿莫迪偷師姚順雨,奧特曼偷師梁文鋒

字母AI2026.09.25 17:17 · 來自北京全文4212字00:00 / 10:57Opus 5.5和GPT-6 Luna,就是混元和DeepSeek。文 | 字母AI正所謂天下文章一大抄,看你會抄不會抄。剛剛發佈的Opus 5.5和GPT-6 Luna,一眼望去,這兩個模型上面滿滿是姚順雨和梁文鋒的影子。或許是因為兩家公司都已經將預訓練做到了極致,為了提升模型的智能以及降低算力成本,所以這兩個新模型都選擇開闢新的戰場。Opus 5.5是對上下文動手,GPT-6 Luna是對緩存動手。這我可熟啊!一個混元,一個DeepSeek啊!但你別說,阿莫迪和奧特曼還真抄得挺像那麼回事。
阿莫迪偷師姚順雨先看一組數字,Artificial Analysis的智能指數里,有一項統計是“跑完一道題平均要輸出多少token”。在這張榜單上,Claude Opus 5.5在max檔位下,平均每題要吐出11.9萬個輸出token,其中8.4萬個是“思考”,3.5萬個是最終答案。而OpenAI的GPT-6 Astra,在同一檔位下只用了2.7萬個 token。大模型想要提升模型的智能水平,傳統路線是在預訓練階段堆數據、堆算力,把智力放進模型的權重裡,一次訓練、反覆使用。這條路線的模型在推理時幾乎不做額外思考。模型訓練時數據價值越高,模型的智能水平就越高。
但傳統路線就怕出現沒見過的題型,傳統模型的泛化是插值。在訓練數據覆蓋的分佈附近,它表現很好。一旦碰到沒見過的題型,或者需要多步推理的題,它就開始瞎編。因為它的“智力”全在權重裡,權重沒見過的模式,它推理時也補不出來。就像你對著木樁練了很久的拳法,結果發現上了戰場以後,對方不會站著不動,而且還會使用武器。另一條是test-time路線。訓練完的模型只是個半成品,真正答題時,先讓它寫一大段推理,想得越久、答得越好。智力不再只來自權重,還來自於每次調用時現場的推理。換句話說,智力被搬進了上下文。Opus 5.5走的就是test-time路線。
官方有這麼一條聲明:除非特別註明,所有成績都跑在“adaptive thinking at max effort”(最大力度的自適應思考)下。而且從這一代開始,Opus 5.5不再提供“關閉thinking模式”的選項。變相就是在說,推理過程就是模型的一部分。代價就是思考過程會消耗更多token,成本也會隨任務難度飆升。Opus 5.5的核心邏輯是,該訓練的數據都訓練得差不多了,預訓練邊際收益見頂,因此智能的增量只能從推理裡找。這種從上下文中找智能的邏輯,姚順雨很早就提出來過。2023年,姚順雨提出Tree of Thoughts(思維樹)這個概念,其本質就是一種test-time。
推理時展開多條思路,邊想邊搜索最優解。同一年,他還提出了ReAct架構,讓模型“推理”和“行動”交替進行。2025年4月,姚順雨發表博客《The Second Half》。文章的核心判斷是,AI的上半場,拼的是“訓練方法與模型”,比如更大的參數、更多的數據、更強的算力。到了下半場,拼的是“如何使用與評估模型”,增量正在從“訓練”挪到“推理與行動”。他在文中寫到,“把推理放進動作空間之後,我們才獲得了‘針對不同決策靈活分配test-time compute(推理時算力)’”的能力。姚順雨把“思考”稱作一種“奇怪的動作”。RL裡的動作是用來改變環境的,比如打開一個箱子,那麼箱子的狀態就會發生改變。
動作的意義,就在於“讓世界發生變化,從而換來獎勵”。但思考不會,即使想了一萬遍,箱子也不會自己打開。姚順雨在文章中舉了個例子,說有兩個盒子,一個有100萬美元、一個空的,這時候,期望收益就是50萬。現在往裡塞進無數個空盒子,期望收益就會越來越低,因為要從無窮多個盒子裡挑那個100萬美元的盒子。然而,如果把“推理”這個動作加進去之後,模型反而更強了,會更容易選中那個100萬美元的盒子。姚順雨的解釋是,那些“空盒子”,你在生活裡以及各種遊戲裡都見過。挑選它們的過程本身,就是在為“選中那個裝錢的盒子”做準備。Opus 5.5,就是把姚順雨的這個理念給工程實現了。奧特曼偷師梁文鋒如果說Opus 5.
5的重點是“怎麼想”,那GPT-6 Luna的重點就是“怎麼便宜地想”。GPT-6 Luna輸入0.1美元/百萬token、輸出0.5美元/百萬token,比上一代GPT-5.6 Luna直接砍半。如果緩存命中,那麼讀一次緩存的價格是0.01美元/百萬token,比標準輸入價便宜90%。模型的每一次調用,都要把你給它的全部上下文“讀一遍”。比如系統提示、長文檔、歷史對話,一個字都不能少。但是這段上下文,重複度極高。Agent每多走一步,前面那一大坨都要重讀一遍。長上下文,就成了燒錢的黑洞。
GPT-6 Luna使用的緩存複用(prompt caching/KV cache複用),它所要解決的就是這件事。同一段上下文,算過一次就存起來,下次直接“讀緩存”、不重算。於是“重複的那部分”,從最貴變成了最便宜。但這套動作,DeepSeek早就做過了。2026年8月2日,DeepSeek上線“Context Caching on Disk”(磁盤上下文緩存),把重複內容緩存在磁盤陣列上,命中時直接取用、跳過重算。當時公告寫著,緩存命中價砍到0.1元/百萬token,比未命中便宜正好也是90%,和GPT-6 Luna一樣。到了V4 Flash這裡,命中0.02元、未命中1元,差50倍。
GPU顯存非常貴,所以能存的KV cache容量有限。但是硬盤很便宜,並且容量大,將KV cache存進去以後成本會大大降低。OpenAI現在做的prompt caching和DeepSeek原理幾乎相同,同一段前綴算過一次存起來,下次直接讀。不止價格,還有架構。GPT-6 Luna的上下文窗口是105萬token,DeepSeek V4是100萬token,兩邊幾乎對齊。但是,100萬上下文的KV cache,按標準注意力機制來算,一半的模型根本扛不住。為此,DeepSeek使用了MLA架構,把Key和Value聯合壓縮進一個低維潛空間,緩存那個潛向量、用時再上採樣還原。
DeepSeek-V2的技術報告裡提到,MLA把KV cache砍掉了93.3%,生成吞吐提升到5.76倍。到了V4,又疊上壓縮稀疏注意力和重度壓縮注意力,V4-Pro在百萬token上下文下,KV cache只有上一代V3.2的10%。除此以外,OpenAI還“偷師”了一招:推測解碼。OpenAI在官方博客裡說,他們跑一個更小的draft(草稿)模型,讓它和主模型並行地“猜”接下來幾個 token,主模型再批量驗收。猜對了,一次前向就能吐好幾個token。OpenAI官方表示,這一項改進讓token生成效率提升了15%以上。
這個思路在2024年的DeepSeek V3裡就有了,DeepSeek使用的是MTP(Multi-Token Prediction,多token預測)。其做法是在主幹模型後面直接掛一個MTP頭,訓練時和主幹一起訓,共享主幹的hidden state。推理時這個頭知道主模型內部狀態長什麼樣,猜得準、驗收通過率高。這個頭可以直接丟掉不影響主幹,也可以留著當草稿機。OpenAI相當於是外掛了一個獨立的小模型去打草稿。兩個模型各跑各的,草稿不知道主模型在想什麼,只是猜完由主模型驗收。雖然方法不太一樣,但是兩者的思想是同一個。小的先猜、大的批量驗,把串行解碼變並行。
天下文章一大抄以前,定義模型的是硅谷,國內AI公司因為算力有限,所以會把這些定義轉換成更便宜的解決辦法。這一輪,反過來了。學術範式和工程範式,都是中國公司做的。美國的巨頭們則負責最後一步,把它做成產品,賣給全世界。過去幾年,大廠的資源、人才、注意力全部all in在預訓練這個主戰場上。大家根據Scaling Law來堆數據、堆算力、刷榜單。可頭部公司都陷入了前文提到的,Anthropic如今的窘境,優質數據幾乎全部訓練完成,模型預訓練邊際收益遞減。
那麼這時,行業的增量自然而然就會出現在第二戰場,比如推理時怎麼想(test-time compute)、上下文怎麼用(context learning)、長上下文怎麼便宜(caching/MLA/稀疏注意力)。這就好比武林裡,大門派花了幾十年練一門功夫。練著練著就發現,武功練到一定程度就不漲了,反而以前那些不起眼的“旁門左道”更能提高功力。這裡還有個反直覺的地方,主戰場上的優勢,到了第二戰場,反而成了“累贅”。手裡攥著最多算力和數據的一方,恰恰最沒動力去摳成本、摳效率。頭部公司已經形成了“反正我堆卡就能解決問題,何必費勁去想更聰明的辦法?”的想法。
這就導致省顯存、省錢這件事,從一開始就不是他們的議題,甚至有點“掉價”。只有算力吃緊的一方,才會把每一分錢都花在刀刃上。DeepSeek的MLA、磁盤緩存、稀疏注意力,本質上都是“窮則思變”。當年它們只是“沒錢的替代方案”,是沒辦法的辦法。可真到全行業開始拼效率的時候,這些“土辦法”忽然成了最硬的通貨。於是才會出現國外“偷師”國內的現狀。
Related
相關文章

為工作而生的 AI:微軟納德拉稱正將 Copilot 打造成全新工作操作系統
作者:故淵 責編:故淵 評論: 9 月 26 日消息,科技媒體 Windows Latest 今天(9 月 26 日)發佈博文,報道稱在微軟發佈 Copilot“超級應用”後,公司首席執行官薩蒂亞 · 納德拉(Satya Nadella)表示:“正在將 Copilot 打造成一個全新的工作操作系統”。

Edge AI Daily 早報(9月26日)
Edge AI Daily2026.09.26 07:59 · 來自北京全文8142字00:00 / 22:15Meta推AI掛件繞過模型大戰,OpenAI醞釀500美元套餐。Runway發佈WorldPrompt,Cursor推Project模式。

Meta 已經想清楚 Muse 靠什麼賺錢
AGI-Signal2026.09.26 07:53 · 來自河南全文4239字00:00 / 11:34眼鏡、鑰匙扣、電腦、手機的入口,可能都是同一個智能體。美東時間週五收盤,Meta 報751.66美元,單日下跌3.3%,總市值約1.9萬億美元。
本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態
導航SecureDoc // EncryptionActive本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態。" AI資訊 | 每日早讀 | 全網數據聚合 | 前沿科學探索 | 行業自由發聲 | 開源創新力量 | AI與人類未來 | 訪問網頁版↗️ | 進群交流🤙 今日摘要 谷歌Gemini 4進入細化階段擬提前發佈 小米MiMo登頂開源權重榜首成本僅為對手零頭 美團龍貓2.

暢銷小說被指用 AI 創作,法國最有名文學獎龔古爾獎將其移出初選名單
作者:清源 責編:清源 評論: 9 月 25 日消息,據路透社報道,當地時間 25 日,法國最負盛名的文學獎項 —— 龔古爾獎主辦方宣佈,將海地裔加拿大作家泰利森 · 奧雷利安的暢銷小說《C'etait Ca ou Mourir(要麼就這樣,要麼死)》移出初選名單,原因是有人指控奧雷利安使用 AI 創作該書。

“AlphaGo”殺進足球場!自我對弈140年,機器人成“梅西終結者”
美國具身智能獨角獸Skild AI推出人形機器人Messinator,其核心是旗艦機器人基礎模型S1,透過自我對弈的方法在虛擬環境中訓練了140年,成功學會帶球、護球和射門等足球技巧。該機器人能透過觀看影片示範來理解任務並執行,顯示AlphaGo的自我對弈策略在物理世界中也獲得了成功驗證。