楊植麟在GTC2026 攤牌:月之暗面把Adam、全注意力和殘差連接全換了,而且全部開源
重點摘要
AI資訊AI新閒資訊正文楊植麟在GTC2026 攤牌:月之暗面把Adam、全注意力和殘差連接全換了,而且全部開源發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘大模型訓練的地基,正在被一家中國公司悄悄撬動。在GTC2026的演講How We Scaled Kimi K2.5中,月之暗面CEO楊植麟沒有隻講K2.
在 GTC2026 的演講舞台上,月之暗面(Moonshot AI)創辦人暨執行長楊植麟沒有把焦點全放在自家最新的 Kimi K2.5 模型上,而是選擇攤開一家開源模型公司過去一年多來最關鍵的技術抉擇。他明確指出,當開源模型試圖追趕閉源前沿時,除了無止境地堆疊參數與算力,還存在另一條路:將 Transformer 時代沿用近十年的三個基礎組件——優化器 Adam、注意力機制與殘差連接——逐一替換,而且這些替代方案已全數開源。楊植麟將這條技術路線拆解為三個核心方向:讓每一個 token 的訓練效益變得更昂貴、讓更長的上下文脈絡真正發揮作用,以及讓多個 AI Agent 能夠協同工作。
此外,他也公開了兩項重要進展:視覺訓練如何反向強化文本推理能力,以及月之暗面最新發表的下一代基礎架構「Attention Residue」。首先面臨的現實瓶頸,是高品質訓練數據即將見頂。網際網路上的有價值文本有限,當模型規模持續膨脹,資料需求只會越來越大,總有一天會撞上數據牆。既然數據難以翻倍,月之暗面的解方是讓模型從同樣的資料中學到更多。他們提出的答案是 MuonClip,用來取代已沿用超過十年的 Adam 優化器。MuonClip 奠基於 Muon 優化器,在更新參數時設法讓不同方向的資訊保持獨立,減少重複與浪費,進而拉高訓練資料的使用效率。
實驗顯示,在使用相同資料量的條件下,MuonClip 的訓練效果接近於把資料量翻倍,既壓低了訓練成本,也推升了模型的能力上限。楊植麟比喻,假如手上擁有 50 萬億個高品質 Token,效率提升一倍就相當於多出 50 萬億 Token,在優質資料日益稀缺的時代,這種效率提升遠比單純加算力更具戰略價值。不過 Muon 本身有個棘手問題:當模型擴展到萬億參數後,注意力層的數值容易失控,最大 logit 可能突然飆升到 1000 以上,遠超出正常範圍的 50 到 100,一旦繼續膨脹,訓練曲線就會發散甚至直接崩潰。
為了解決這個問題,月之暗面設計了 QK-Clip,在前向計算時即時監控每個注意力頭的最大 logit,一旦超出安全範圍就同步縮放 Query 與 Key 的投影數值,把數值壓回穩定區間。這個機制不改變收斂效果,只負責維持數值穩定。靠著 QK-Clip,Muon 成功擴展到萬億參數規模,並訓練了超過 15 萬億 Token,過程中完全沒有出現任何一次 loss spike。第二個方向是讓長上下文真正發揮效果。
楊植麟引用 Scaling Law 論文作者 Jared Kaplan 等人的實驗指出,LSTM 讀到一定長度後表現就難以提升,但 Transformer 的上下文越長,預測通常越準確,且未見明顯的飽和點。這個特性在 Agent 時代尤其關鍵,因為複雜任務可能持續數天甚至數週,模型必須記住先前的行動、結果與已失敗的方向,長上下文若不能持續提供有效資訊,任務鏈條很容易中斷。然而標準全注意力的計算量隨上下文長度呈平方增長,上下文擴增十倍,計算量可能增加百倍,到了百萬 Token 等級,訓練與推論成本都極為驚人。
月之暗面的解法是 Kimi Linear,核心是名為 KDA(Kimi Delta Attention)的線性注意力機制。傳統線性注意力只有一個全域衰減係數,等同所有內容共用同一個遺忘按鈕;KDA 則將一個衰減係數拆成多個,不同資訊通道可以使用不同的遺忘速度。衰減慢的通道保留長距離資訊,衰減快的通道則能迅速騰出空間吸收新內容。實際使用時,Kimi Linear 以三比一的比例混合線性注意力層與全注意力層,楊植麟稱這是第一個在短上下文、長輸入與長輸出任務上都能全面超越全注意力的架構,且當上下文擴展到百萬 Token 甚至更長時,效率優勢更為明顯。
第三個方向是從單一 Agent 發展為一支 Agent 團隊,月之暗面稱之為 Agent Swarm。它的運作方式類似一家公司:一個主 Agent 擔任 CEO 角色,負責理解目標、拆解任務並分配給多個子 Agent,這些子 Agent 可以分別扮演研究員、程式設計師、數據分析師與事實查核員,完成後再由主 Agent 彙總結果。最大價值在於將串行任務改為並行,過去一個 Agent 必須依序搜索、閱讀、分析、編寫程式與查核,現在幾十甚至幾百個 Agent 可以同時作業。
要訓練這種協作並不容易,月之暗面設計了三種獎勵機制:實例化獎勵鼓勵主 Agent 創建更多可並行的子任務,避免退化回串行模式;完成獎勵要求子任務確實完成,防止為了刷獎勵而批量開設空任務;最終結果獎勵則判斷任務是否真正解決。三種獎勵的權重會隨著訓練動態調整,前期側重任務拆解與並行化,後期轉向最終結果。從現場演示來看,Agent Swarm 能夠同時下載閱讀數百個資訊來源完成研究、並行撰寫上百頁文獻綜述的不同章節,以及同時分析十個數據集。Kimi K2.5 發表時已支援最多 100 個 Agent 並行,任務最多可執行 1500 個步驟;而今年 4 月推出的 K2.
6 更將並行上限提高到了 300 個。一個意外收穫來自視覺與文本的融合。K2.5 與前代 K2 的關鍵差異在於採用早期融合訓練:過去許多開源多模態模型走後期融合路線,先用約 20 萬億文本 Token 訓練出語言模型,再用約 2 萬億多模態 Token 將視覺能力貼上去;K2.5 則從訓練一開始就把視覺與文本數據混在一起,在 K2 文本基座上又訓練了約 15 萬億混合 Token。這帶來兩個讓楊植麟感到振奮的結果。其一,只訓練視覺任務也能提升文本推理:研究團隊讓模型數數、識圖、做視覺問答,完全沒有加入數學或程式訓練,但文本推理能力卻同步增強。
換句話說,模型在練習「看」的同時,「思考」能力也進步了。其二,反向來看,如果文本基座夠強,模型甚至不一定需要專門的視覺監督微調數據——K2.5 採用零視覺 SFT 方案,所有監督微調數據都是純文本,再透過文本與視覺聯合的強化學習獲得視覺能力,最終在視覺任務上仍接近最先進水準。楊植麟認為,這種雙向遷移來自早期融合:當文本與視覺進入同一個表徵空間,一個模態學到的能力才有機會遷移到另一個模態,這也是 K2.5 能夠看圖寫程式碼的根基。演講尾聲,楊植麟介紹了月之暗面在演講前兩天(3 月 15 日)剛發表的新研究 Attention Residue(注意力殘差)。
殘差連接是 2015 年由何愷明等人提出的深度網路基礎技術,如今已是 Transformer 的標準組件,它讓每一層既能處理上層結果,又能保留一條直接傳遞資訊的通道,使深層模型得以穩定訓練。楊植麟援引 Ilya Sutskever 的說法,將殘差連接理解為旋轉了 90 度的 LSTM——LSTM 在時間維度上傳遞資訊,殘差連接則在深度維度上傳遞資訊。既然 Transformer 已經用注意力取代了 LSTM 在時間維度上的循環,那麼深度維度是否也能用同樣的方式替換?
Attention Residue 正是這個思路的產物:標準殘差主要依賴上一層的輸出,而 Attention Residue 允許當前層查看所有前序層的輸出,再透過注意力決定哪些歷史資訊保留、哪些忽略,讓模型從被動接收上層結果,變成主動從整個計算歷史中挑選資訊。為了控制成本,實際使用時採用分塊版本 Block Attention Residual,每 16 層組成一個塊,塊內仍使用標準殘差,塊間才採用注意力殘差;實驗顯示大約 8 個塊就能取得大部分收益。
這項技術帶來了約 24% 的 Token 效率提升,按照楊植麟的算法,50 萬億 Token 的效率提高 24%,相當於額外增加 12 萬億 Token,在 GPQA、MATH、HumanEval 等推理、數學與程式測試上的提升尤為明顯。將這三項技術並列來看,月之暗面的替代清單清晰得近乎直接:Adam 換成 MuonClip、全注意力換成 Kimi Linear、殘差連接換成 Attention Residue,分別對應如何從有限數據中學到更多、如何更有效率地運用超長上下文,以及如何讓深層網路更靈活地傳遞資訊。三者都能相對獨立地替換現有組件,且都已開源。
這些技術能否直接疊加、增益能否簡單相乘,目前尚未經過完整驗證,但它們至少說明了一個事實:許多被認為已經足夠好的基礎組件,可能遠未達到終點。在優質數據越來越少、訓練成本越來越高的當下,重新設計優化器、注意力機制與殘差連接,同樣能帶來可觀的進步。而這也正是楊植麟整場演講想傳達的核心訊息——開源模型不能只是開放,還必須具備足夠的競爭力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。