楊植麟在GTC2026 攤牌:月之暗面把Adam、全注意力和殘差連接全換了,而且全部開源
重點摘要
AI資訊AI新閒資訊正文楊植麟在GTC2026 攤牌:月之暗面把Adam、全注意力和殘差連接全換了,而且全部開源發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘大模型訓練的地基,正在被一家中國公司悄悄撬動。在GTC2026的演講How We Scaled Kimi K2.5中,月之暗面CEO楊植麟沒有隻講K2.
在 GTC2026 的演講舞台上,月之暗面(Moonshot AI)創辦人暨執行長楊植麟沒有把焦點全放在自家最新的 Kimi K2.5 模型上,而是選擇攤開一家開源模型公司過去一年多來最關鍵的技術抉擇。他明確指出,當開源模型試圖追趕閉源前沿時,除了無止境地堆疊參數與算力,還存在另一條路:將 Transformer 時代沿用近十年的三個基礎組件——優化器 Adam、注意力機制與殘差連接——逐一替換,而且這些替代方案已全數開源。 楊植麟將這條技術路線拆解為三個核心方向:讓每一個 token 的訓練效益變得更昂貴、讓更長的上下文脈絡真正發揮作用,以及讓多個 AI Agent 能夠協同工作。此外,他也公開了兩項重要進展:視覺訓練如何反向強化文本推理能力,以及月之暗面最新發表的下一代基礎架構「Attention Residue」。 首先面臨的現實瓶頸,是高品質訓練數據即將見頂。網際網路上的有價值文本有限,當模型規模持續膨脹,資料需求只會越來越大,總有一天會撞上數據牆。既然數據難以翻倍,月之暗面的解方是讓模型從同樣的資料中學到更多。他們提出的答案是 MuonClip,用來取代已沿用超過十年的 Adam 優化器。MuonClip 奠基於 Muon 優化器,在更新參數時設法讓不同方向的資訊保持獨立,減少重複與浪費,進而拉高訓練資料的使用效率。實驗顯示,在使用相同資料量的條件下,MuonClip 的訓練效果接近於把資料量翻倍,既壓低了訓練成本,也推升了模型的能力上限。楊植麟比喻,假如手上擁有 50 萬億個高品質 Token,效率提升一倍就相當於多出 50 萬億 Token,在優質資料日益稀缺的時代,這種效率提升遠比單純加算力更具戰略價值。 不過 Muon 本身有個棘手問題:當模型擴展到萬億參數後,注意力層的數值容易失控,最大 logit 可能突然飆升到 1000 以上,遠超出正常範圍的 50 到 100,一旦繼續膨脹,訓練曲線就會發散甚至直接崩潰。為了解決這個問題,月之暗面設計了 QK-Clip,在前向計算時即時監控每個注意力頭的最大 logit,一旦超出安全範圍就同步縮放 Query 與 Key 的投影數值,把數值壓回穩定區間。這個機制不改變收斂效果,只負責維持數值穩定。靠著 QK-Clip,Muon 成功擴展到萬億參數規模,並訓練了超過 15 萬億 Token,過程中完全沒有出現任何一次 loss spike。 第二個方向是讓長上下文真正發揮效果。楊植麟引用 Scaling Law 論文作者 Jared Kaplan 等人的實驗指出,LSTM 讀到一定長度後表現就難以提升,但 Transformer 的上下文越長,預測通常越準確,且未見明顯的飽和點。這個特性在 Agent 時代尤其關鍵,因為複雜任務可能持續數天甚至數週,模型必須記住先前的行動、結果與已失敗的方向,長上下文若不能持續提供有效資訊,任務鏈條很容易中斷。然而標準全注意力的計算量隨上下文長度呈平方增長,上下文擴增十倍,計算量可能增加百倍,到了百萬 Token 等級,訓練與推論成本都極為驚人。 月之暗面的解法是 Kimi Linear,核心是名為 KDA(Kimi Delta Attention)的線性注意力機制。傳統線性注意力只有一個全域衰減係數,等同所有內容共用同一個遺忘按鈕;KDA 則將一個衰減係數拆成多個,不同資訊通道可以使用不同的遺忘速度。衰減慢的通道保留長距離資訊,衰減快的通道則能迅速騰出空間吸收新內容。實際使用時,Kimi Linear 以三比一的比例混合線性注意力層與全注意力層,楊植麟稱這是第一個在短上下文、長輸入與長輸出任務上都能全面超越全注意力的架構,且當上下文擴展到百萬 Token 甚至更長時,效率優勢更為明顯。 第三個方向是從單一 Agent 發展為一支 Agent 團隊,月之暗面稱之為 Agent Swarm。它的運作方式類似一家公司:一個主 Agent 擔任 CEO 角色,負責理解目標、拆解任務並分配給多個子 Agent,這些子 Agent 可以分別扮演研究員、程式設計師、數據分析師與事實查核員,完成後再由主 Agent 彙總結果。最大價值在於將串行任務改為並行,過去一個 Agent 必須依序搜索、閱讀、分析、編寫程式與查核,現在幾十甚至幾百個 Agent 可以同時作業。要訓練這種協作並不容易,月之暗面設計了三種獎勵機制:實例化獎勵鼓勵主 Agent 創建更多可並行的子任務,避免退化回串行模式;完成獎勵要求子任務確實完成,防止為了刷獎勵而批量開設空任務;最終結果獎勵則判斷任務是否真正解決。三種獎勵的權重會隨著訓練動態調整,前期側重任務拆解與並行化,後期轉向最終結果。從現場演示來看,Agent Swarm 能夠同時下載閱讀數百個資訊來源完成研究、並行撰寫上百頁文獻綜述的不同章節,以及同時分析十個數據集。Kimi K2.5 發表時已支援最多 100 個 Agent 並行,任務最多可執行 1500 個步驟;而今年 4 月推出的 K2.6 更將並行上限提高到了 300 個。 一個意外收穫來自視覺與文本的融合。K2.5 與前代 K2 的關鍵差異在於採用早期融合訓練:過去許多開源多模態模型走後期融合路線,先用約 20 萬億文本 Token 訓練出語言模型,再用約 2 萬億多模態 Token 將視覺能力貼上去;K2.5 則從訓練一開始就把視覺與文本數據混在一起,在 K2 文本基座上又訓練了約 15 萬億混合 Token。這帶來兩個讓楊植麟感到振奮的結果。其一,只訓練視覺任務也能提升文本推理:研究團隊讓模型數數、識圖、做視覺問答,完全沒有加入數學或程式訓練,但文本推理能力卻同步增強。換句話說,模型在練習「看」的同時,「思考」能力也進步了。其二,反向來看,如果文本基座夠強,模型甚至不一定需要專門的視覺監督微調數據——K2.5 採用零視覺 SFT 方案,所有監督微調數據都是純文本,再透過文本與視覺聯合的強化學習獲得視覺能力,最終在視覺任務上仍接近最先進水準。楊植麟認為,這種雙向遷移來自早期融合:當文本與視覺進入同一個表徵空間,一個模態學到的能力才有機會遷移到另一個模態,這也是 K2.5 能夠看圖寫程式碼的根基。 演講尾聲,楊植麟介紹了月之暗面在演講前兩天(3 月 15 日)剛發表的新研究 Attention Residue(注意力殘差)。殘差連接是 2015 年由何愷明等人提出的深度網路基礎技術,如今已是 Transformer 的標準組件,它讓每一層既能處理上層結果,又能保留一條直接傳遞資訊的通道,使深層模型得以穩定訓練。楊植麟援引 Ilya Sutskever 的說法,將殘差連接理解為旋轉了 90 度的 LSTM——LSTM 在時間維度上傳遞資訊,殘差連接則在深度維度上傳遞資訊。既然 Transformer 已經用注意力取代了 LSTM 在時間維度上的循環,那麼深度維度是否也能用同樣的方式替換?Attention Residue 正是這個思路的產物:標準殘差主要依賴上一層的輸出,而 Attention Residue 允許當前層查看所有前序層的輸出,再透過注意力決定哪些歷史資訊保留、哪些忽略,讓模型從被動接收上層結果,變成主動從整個計算歷史中挑選資訊。為了控制成本,實際使用時採用分塊版本 Block Attention Residual,每 16 層組成一個塊,塊內仍使用標準殘差,塊間才採用注意力殘差;實驗顯示大約 8 個塊就能取得大部分收益。這項技術帶來了約 24% 的 Token 效率提升,按照楊植麟的算法,50 萬億 Token 的效率提高 24%,相當於額外增加 12 萬億 Token,在 GPQA、MATH、HumanEval 等推理、數學與程式測試上的提升尤為明顯。 將這三項技術並列來看,月之暗面的替代清單清晰得近乎直接:Adam 換成 MuonClip、全注意力換成 Kimi Linear、殘差連接換成 Attention Residue,分別對應如何從有限數據中學到更多、如何更有效率地運用超長上下文,以及如何讓深層網路更靈活地傳遞資訊。三者都能相對獨立地替換現有組件,且都已開源。這些技術能否直接疊加、增益能否簡單相乘,目前尚未經過完整驗證,但它們至少說明了一個事實:許多被認為已經足夠好的基礎組件,可能遠未達到終點。在優質數據越來越少、訓練成本越來越高的當下,重新設計優化器、注意力機制與殘差連接,同樣能帶來可觀的進步。而這也正是楊植麟整場演講想傳達的核心訊息——開源模型不能只是開放,還必須具備足夠的競爭力。
Related
相關文章

阿里甩出“配音”神器:能調整情緒,還會說方言
阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

手機、座艙、具身,中國最大端側獨角獸低調交出高分卷
面壁智能作為中國最大端側獨角獸,於WAIC展示手機、汽車、機器人等端側AI落地成果,並與三星、吉利等企業合作。該公司強調端側AI產業化需超越模型本身,建立跨終端適配、生態與標準,正逐步成為端側智能產業定義者。

關於面壁智能,聊聊我的一些新思考
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

Token收費,不再“天經地義”?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

AI眼鏡繼續進化:不只看見,還要辦事
過去兩年,大模型技術加速導入智慧眼鏡,翻譯、拍攝等應用功能密集問世,成為市場主流。然而,隨著這些能力逐漸成為標配,AI眼鏡所面臨的新課題也隨之浮現——業界開始思考,如何讓眼鏡從「看見」進化到「辦事」,真正成為能主動協助用戶完成任務的隨身裝置。

16萬Star的OpenCode徹底重寫:API全部重做、Bun換Node、桌面端遷移Electron
擁有超過 16 萬顆 GitHub 星星、每月活躍開發者高達 750 萬人的開源專案 OpenCode,在 2026 年 7 月正式推出了 2.0 版本。這不僅是一次例行更新,而是從底層架構到使用者體驗的全面翻新。聯合創始人 Dax Raad 在近期受訪時坦言,這是他職業生涯中「第三次才做對」的產品:0 是原型試水,1.x 是市場驗證,而 2.0 則是在徹底理解整個領域後,從零開始的推倒重來。 這次重寫的核心變革之一,就是完全重構了應用程式介面(API)。