蘇神覆盤 Kimi K3:896 個專家背後,藏著哪些關鍵技術取捨?
重點摘要
從異常激活到專家擁堵,拆解超大模型訓練難點。 作者丨鄭佳美 編輯丨岑 峰 這幾天,Kimi 研究員、RoPE 提出者蘇劍林發佈了一篇名為《簡單談談 K3 的 MoE 和 Attention》的文章,集中討論了 Kimi K3 在專家架構、訓練穩定性、負載均衡和注意力設計上的幾項關鍵取捨。蘇神在文章中提到 K3 擁有 2.8 萬億總參數,並配置了 896 個路由專家。但模型不會讓每個 Token 調用全部專家,而是隻從中激活 16 個。
Kimi 研究員、RoPE 提出者蘇劍林近日發布一篇名為《簡單談談 K3 的 MoE 和 Attention》的技術文章,針對 Kimi K3 在專家架構、訓練穩定性、負載均衡以及注意力設計上的多項關鍵取捨進行深入剖析。這篇覆盤文章揭露了這款超大規模模型在追求容量擴張的同時,如何透過精密的工程設計來控制計算成本與訓練難度,為業界理解下一代大語言模型的底層邏輯提供了重要視角。Kimi K3 的總參數規模達到驚人的 8 兆,並配置了 896 個路由專家。然而,模型的運作並非讓每個 Token 都調用全部專家,而是僅從中動態激活 16 個。
這種設計直接反映了 K3 的核心指導原則:模型容量可以持續擴張,但單次推理的計算成本絕不能隨著總參數量和上下文長度的增長而同步失控。透過稀疏激活機制,K3 在保有龐大知識儲備的同時,有效控制了實際運算所需的資源。在注意力結構方面,K3 並未沿用單一方案,而是將 KDA 與 Gated MLA 兩種機制交替排列。這種混合式架構的選擇,是為了讓模型在處理長上下文時,能夠以更低的成本維持高效的注意力計算。KDA 與 Gated MLA 的組合,使模型在捕捉長期依賴關係與降低記憶體開銷之間取得了平衡,這對於處理動輒數十萬字的複雜任務至關重要。
蘇劍林在文章中特別強調,當專家數量急劇增加時,Router 的任務不再只是準確選擇合適的專家,更要避免少數熱門專家持續過載而導致瓶頸。同時,當 Token 被分配到不同 GPU 上的專家時,跨設備通信的開銷也會迅速攀升,成為制約訓練效率的關鍵瓶頸。這些都是超大規模 MoE 模型在實際訓練中必須面對的系統性挑戰。此外,更長的上下文會直接推高 KV Cache 的記憶體佔用與注意力計算成本。為了緩解這項壓力,K3 採用了 BF16、FP8 等低精度訓練技術來節省資源。然而,低精度訓練雖然能有效降低記憶體與計算負擔,卻更容易受到異常激活值的影響,導致數值不穩定,進而影響訓練收斂。
蘇劍林在文中詳細拆解了從異常激活到專家擁堵的連鎖反應,揭示了超大模型訓練中隱藏的細微風險。文章進一步探討了這些技術取捨之間的相互關聯。例如,專家數量的增加雖然帶來了更細緻的能力分工,但也加劇了負載不均與通信瓶頸;而混合注意力設計雖然降低了長上下文成本,卻也對訓練穩定性提出了更高要求。蘇劍林的分析顯示,K3 的整體設計並非單點突破,而是在多個互相制約的維度之間進行了系統性的權衡與平衡。蘇劍林作為 RoPE(旋轉位置編碼)的提出者,其觀點在學術界與工業界具有相當影響力。
他此次親自覆盤 K3 的技術細節,不僅是對自家模型的一次深度解剖,更為整個 AI 社群提供了關於超大規模 MoE 模型設計的珍貴實戰經驗。文章內容涵蓋了從理論架構到工程落地的完整鏈路,對於研究人員與工程師而言,具有極高的參考價值。透過蘇劍林的技術覆盤,可以清晰地看到 Kimi K3 的設計哲學:在追求極致規模的同時,必須透過精密的稀疏化與混合架構,將計算成本與訓練風險控制在可管理的範圍內。這不僅是技術上的勝利,更代表了當前大模型發展從「暴力擴張」走向「精細調校」的重要轉變。K3 的經驗證明,未來的模型競賽,將不僅僅是參數量的比拼,更是系統工程與演算法創新深度融合的較量。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。