雷峰網模型更新

蘇神覆盤 Kimi K3:896 個專家背後,藏著哪些關鍵技術取捨?

2026年8月6日 13:45

重點摘要

從異常激活到專家擁堵,拆解超大模型訓練難點。 作者丨鄭佳美 編輯丨岑 峰 這幾天,Kimi 研究員、RoPE 提出者蘇劍林發佈了一篇名為《簡單談談 K3 的 MoE 和 Attention》的文章,集中討論了 Kimi K3 在專家架構、訓練穩定性、負載均衡和注意力設計上的幾項關鍵取捨。蘇神在文章中提到 K3 擁有 2.8 萬億總參數,並配置了 896 個路由專家。但模型不會讓每個 Token 調用全部專家,而是隻從中激活 16 個。

站內 AI 整理稿

從異常激活到專家擁堵,拆解超大模型訓練難點。

作者丨鄭佳美 編輯丨岑 峰 這幾天,Kimi 研究員、RoPE 提出者蘇劍林發佈了一篇名為《簡單談談 K3 的 MoE 和 Attention》的文章,集中討論了 Kimi K3 在專家架構、訓練穩定性、負載均衡和注意力設計上的幾項關鍵取捨。

8 萬億總參數,並配置了 896 個路由專家。

但模型不會讓每個 Token 調用全部專家,而是隻從中激活 16 個。

在注意力結構上,K3 也沒有沿用單一方案,而是將 KDA 與 Gated MLA 交替排列。

這些配置共同指向了 K3 的基本設計思路:模型可以繼續擴大容量,但不能讓計算成本隨著總參數量和上下文長度同步增長。

更多專家意味著模型擁有更細緻的能力分工,混合注意力則讓模型能夠以更低成本處理長上下文。

當專家數量增加時,Router 不僅要準確選擇專家,還要避免少數專家持續過載;當 Token 被髮送到不同 GPU 上的專家時,跨設備通信也會迅速增加。

與此同時,更長的上下文會推高 KV Cache 和注意力計算成本,而 BF16、FP8 等低精度訓練雖然能夠節省資源,卻更容易受到異常激活的影響。

Related

相關文章

IT之家模型更新

國內已知最大規模!消息稱字節跳動正討論訓練超 5 萬億參數模型

首頁 > 智能時代>人工智能 國內已知最大規模!消息稱字節跳動正討論訓練超 5 萬億參數模型 2026/8/6 21:42:47 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,晚點 LatePost 今天(6 日)晚間爆料稱,字節跳動正在討論訓練一個參數規模超 5 萬億的模型,超過阿里的 Qwen 3.8-Max(2.4 萬億參數)和月之暗面的 K3(2.

剛剛

AI辦公大戰,賣模型的DeepSeek們怎麼活?

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體模型更新

AI辦公大戰,賣模型的DeepSeek們怎麼活?

AI辦公大戰,賣模型的DeepSeek們怎麼活?壹度Pro2026.08.06 17:45 · 來自北京全文4736字00:00 / 14:23亂戰時代。文 | 壹度Pro騰訊的AI業務終於做出來點樣子,甚至引發了阿里、字節跳動兩家大廠的組織結構變革——調頭重押注AI辦公。2026年3月,騰訊決定全力押注辦公智能體,資源逐漸歸攏至WorkBuddy。騰訊甚至破天荒做起了線下推廣,把廣告鋪滿了深圳和上海地鐵車廂。

剛剛

DeepSeek剛宣佈漲價,小扎立馬“拼命”:Meta新模型打出更低骨折價,但要一點“數據稅”

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

DeepSeek也扛不住了?API降價後又將大幅漲價

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

11 分鐘前
IT之家模型更新

華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益

首頁 > 智能時代>人工智能 華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益 2026/8/6 16:13:17 來源:IT之家 作者:汪淼 責編:汪淼 評論: 感謝IT之家網友 不一樣的體驗 的線索投遞! IT之家 8 月 6 日消息,強化學習已成為大模型訓練主流範式,推動模型技術向行業核心場景工程化落地。其中,訓推一致至關重要,因推理與訓練過程耦合,基礎設施差異易放大不確定性。

32 分鐘前