Moonshot AI Open-Sources MoonEP: A Perfectly Balanced Expert Parallelism Library for MoE Training
重點摘要
Moonshot AI has open-sourced MoonEP, an Expert Parallelism (EP) communication library for distributed Mixture-of-Experts (MoE) workloads.
Moonshot AI 正式將其專家平行(Expert Parallelism,EP)通訊函式庫 MoonEP 開源,以 MIT 授權釋出。這套函式庫專為分散式混合專家(Mixture-of-Experts,MoE)模型的訓練與推論設計,目標是讓大規模專家平行運算的通訊效率大幅提升。MoonEP 在 Kimi K3 開放日(Kimi K3 Open Day)中同步亮相,與 K3 模型權重、技術報告,以及另外兩套基礎架構程式碼 FlashKDA 與 AgentEnv 一同公開。其中 FlashKDA 先前已開源,而 MoonEP 與 AgentEnv 則是本次新增的開源專案。MoonEP 正是 Moonshot AI 宣稱能讓 Kimi K3 模型擴展效率提升 2.5 倍的關鍵技術之一。Kimi K3 是一個擁有 2.8 兆參數的 MoE 模型,具備原生視覺能力與 100 萬 token 的上下文長度。 專家平行架構在 MoE 模型中扮演核心角色,但長期面臨一個結構性問題:路由器的分配極不平均。在專家平行機制中,路由器會將每個 token 送到其 Top-K 個專家,而這些專家分散在不同的運算節點(rank)上。然而路由器的決策很少能達到完美平衡,某些專家收到的 token 數量遠多於其他專家。Moonshot AI 在 GitHub 儲存庫中以 maxvio 指標量化這種偏差,其定義為 max_e (T_e / T̄) − 1,其中 T_e 是路由到專家 e 的 token 數,T̄ 是完美平衡下的期望值。maxvio 為 0 代表完全平衡,數值越大表示偏差越嚴重。這種不平衡的代價並非偶然,而是結構性的——集體通訊的延遲由最慢的參與者決定,因此最熱門的 rank 會直接拖慢整個迭代時間。更糟的是,每個 rank 的 token 數量每步都在變化,動態的激活形狀會導致 GPU 記憶體碎片化,並迫使每層進行主機端同步。 MoonEP 的核心創新在於引進動態冗餘專家(dynamic redundant experts)。其設計建立一個硬性不變量:無論路由偏差多大,每個 rank 都會收到恰好 S × K 個 token(S 是每個 rank 的輸入 token 數,K 是每個 token 路由的 Top-K 專家數)。這項保證是透過直接從當前路由器輸出中,即時規劃少量冗餘專家來達成。這些被複製的專家會在專家計算之前被預取(prefetch)。在反向傳播階段,這些冗餘專家的梯度會被歸約回它們原本所在的 rank。 MoonEP 的設計可歸納為三個特性:第一,完美平衡,即上述 S × K 保證,透過線上規劃的冗餘專家實現。第二,線上規劃,採用一個近乎最優的 GPU 規劃核心,運算開銷極低,基於 CUTLASS CuTe DSL 實作,並且在 setup.py 中固定使用 nvidia-cutlass-dsl==4.4.2 版本。第三,零拷貝與靜態形狀,合併了置換(permute)與反置換(unpermute)操作,token 會直接寫入遠端 rank 上已按專家分組的對應位置,然後將緩衝區的視圖返回給計算單元。這只需要一個固定大小的 S × K 緩衝區,且靜態已知的形狀消除了每層 MoE 所需的主機端同步。 MoonEP 與訓練或推論框架之間有明確的記憶體合約:每個專家投影必須對應一個連續的對稱記憶體權重張量,加上一個由規劃器產生的 cu_seqlens。VM 群組 GEMM 會接收一個單一的 [E+B, H, H'] 權重張量,其中 E 是總路由專家數,B 是每個 rank 的預取槽位數,H 是隱藏層大小,H' 是專家 FFN 中間層大小。由 dispatch 回傳的 cu_seqlens[E+B] 則負責選取哪些專家行是活躍的。連續性是硬性要求,因為群組 GEMM 僅透過行索引來定址專家。記憶體佈局清晰分割:行 [0, E) 存放所有 rank 的本機專家,每個 rank 擁有 E/R 行。每個 chunk 實際上是該 rank 的參數記憶體,透過對稱記憶體映射到所有 rank。行 [E, E+B) 則是本機的預取槽位,由 buffer.prefetch_weight 填入。預取槽位來自一個所有層共享的處理程序全域池,這意味著額外的記憶體成本是每個投影 B 個專家權重,而非每層 B 個。 如何設定 B 取決於工作負載。訓練階段必須使用 B = E/R,因為規劃器最多只會從每個 rank 的一個遠端主機群組複製專家,這個保證確保群組 GEMM 觸及的每個專家都是本機的。推論階段則允許 B < E/R,官方 README 建議 B = 3 至 4。如果某個 rank 需要的不同遠端專家數量超過 B,群組 GEMM 會直接透過對稱映射從主機 rank 讀取溢出的權重——速度會稍慢,但不影響正確性。訓練階段,權重佈局在 fp32 中會對應一個每個投影的 [E+B, H, H'] 梯度緩衝區。關鍵是,行 [E, E+B) 是由一個獨立的歸約緩衝區支持,而非參數梯度。被複製的專家的梯度是暫時的,必須對框架本身的梯度歸約不可見。每個 rank 會將所有 R 個歸約緩衝區映射為一個 [R, B, H, H'] 視圖,然後 reduce_grad 會從每個 rank 的槽位中讀取自己的專家數據,透過 NVLink 累加到本機參數梯度,並清空已消耗的槽位。 Moonshot AI 在 H20 硬體上,以 EP=8 的設定,對路由器偏差進行了全面掃描,並與 DeepEP v2 進行了基準測試。比較腳本 bench_vs_deepep.py 的預設參數為 S=8192、E=384、H=7168、K=8、H'=2048、32 個 SM,maxvio 目標設定為 0.2、1、10 和 20。兩個函式庫都接收來自相同種子的相同路由矩陣。測試結果顯示兩項重要發現:第一,零拷貝架構使通訊速度更快,因為消除了傳統通訊中從通訊緩衝區複製到使用者緩衝區的耗時步驟,因此在所有偏差等級下,MoonEP 的通訊時間都穩定低於 DeepEP v2。第二,完美平衡讓 MoonEP 幾乎不受偏差影響,其通訊時間隨著 maxvio 增加幾乎保持不變,而 DeepEP v2 的延遲則由最熱門 rank 決定,因此隨著偏差增加而持續惡化。 總結而言,MoonEP 的核心貢獻在於:每個 EP rank 都能確保收到恰好 S × K 個 token,無論路由偏差多大;平衡來自於在 GPU 上即時規劃的冗餘專家,並在專家計算前預取;靜態形狀消除了每層 MoE 的主機同步,並阻止了導致 DeepEP OOM 的記憶體碎片化;訓練階段需設定 B = E/R 預取槽位,推論階段可降至 B = 3 至 4 而不影響正確性。MoonEP 在 Kimi K3 開放日以 MIT 授權釋出,與 FlashKDA 和 AgentEnv 共同構成 Moonshot AI 開源基礎架構的最新陣容。
Related
相關文章
納德拉公開攤牌:別隻信 OpenAI 和 Anthropic,微軟要做最便宜的那個
AI資訊AI新閒資訊正文納德拉公開攤牌:別隻信 OpenAI 和 Anthropic,微軟要做最便宜的那個發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘微軟正處在一個前所未有的微妙位置——既是全球最大的雲服務商之一,又同時持有 OpenAI 和 Anthropic 兩家頭部 AI 實驗室的鉅額股份。但隨著兩家公司不斷嚮應用層和智能體基礎設施擴張,試圖直接掌控客戶關係,CEO 薩提亞·納德拉顯然不打算讓這股趨勢威脅到微軟的現金牛。微軟剛剛交出一份炸裂的財報:第四季度營收 900 億美元、淨利潤 358 億美元,整個 2026 財年營收 3318 億美元、淨利潤 1337 億美元。納德拉的策略很清晰——他最近反覆向企業客戶喊話,不要只依賴前沿 AI 實驗室的模型,把智能體框架與底層模型綁定在一起是危險的,因為這意味著要把大量內部機密交給可信度存疑的模型廠商。從 Hugging Face 事件到自研 MAI,微軟亮出全套底牌在週三的財報電話會議上,納德拉直接向華爾街分析師攤牌:這是微軟的機會。他提出核心架構原則是"將智能體框架與模型分離",任何模型在任何時候都可替換——而微軟恰好以 Copilot 品牌銷售一系列智能體框架,包括 GitHub Copilot。他甚至拿上週的 Hugging Face 入侵事件作為佐證:OpenAI 一個未發佈模型突破沙盒入侵 Hugging Face 後,後者最初嘗試使用一個私有前沿模型分析攻擊,結果該模型拒絕協助,最終不得不轉向中國開源模型 Z.ai GLM 5.2 才完成防禦。納德拉同時亮出了微軟的自研武器庫:MAI 系列模型搭配自研 Maya 芯片,在 Maya 200 上運行時每瓦性能提升 40%。微軟雲上提供超過 11000 個模型,涵蓋 OpenAI、Anthropic、Mistral、xAI 及自研 MAI 家族,
OpenAI CEO潑冷水:AI 不會帶來四天工作制,超級智能時代人只會更忙
AI資訊AI新閒資訊正文OpenAI CEO潑冷水:AI 不會帶來四天工作制,超級智能時代人只會更忙發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘OpenAI CEO 薩姆·奧特曼近日在公開採訪中拋出一個打破大眾期待的觀點——AI 不會像很多人預想的那樣開啟每週工作四天的黃金時代。
不押注單一AI巨頭,微軟推出MAI系列模型尋找新增長路徑
AI資訊AI新閒資訊正文不押注單一AI巨頭,微軟推出MAI系列模型尋找新增長路徑發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘微軟CEO薩蒂亞·納德拉在最新季度財報電話會議上表示,微軟將推動企業採用多模型架構,並加大自主研發AI模型、智能體及安全產品的投入,以降低對單一前沿AI實驗室的依賴。
越罵越賺?羅技上季度在中國賺翻了,曾罵用戶像狗;智駕「小藍燈」將被禁用!相關國標已啟動制修訂;曝月之暗面完成超35億美元F輪融資
要聞提示1.瀘溪河桃酥被曝疑似吃出“金屬牙冠”,山姆緊急下架2.越罵越賺?羅技上季度在中國賺翻了,曾罵用戶像狗3.智駕“小藍燈”將被禁用!相關國標已啟動制修訂4.曝月之暗面完成超35億美元F輪融資,估值升至500億美元5.美團月付遭批量盜刷,多地用戶中招?回應:或遭遇電信詐騙,正配合警方調查6.業績由盈轉虧!粉筆投資虧損830萬美元,前CEO張小龍曾鼓勵年輕人炒股7.
Kimi K3 超長上下文模型服務降價
Kimi K3 超長上下文模型服務降價。 團隊發佈 上下文配置版本價格降半。新版本在保留核心時 降低開發成本。代理 ��� 可以節省資源配額。接入現已開啟信任機制 (o゚▽゚)o。
高性能超長上下文推理內核
AI資訊日報|高性能超長上下文推理內核 高性能超長上下文推理內核。 月之暗面開源 超長文本計算優化內核。內核 981 ��� 提高 計算效率。該方案主要優化了推理場景。它能在長文本下提供極高吞吐。