AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs
重點摘要
AMD 發布 Instella-MoE-16B-A3B,一個完全開放的混合專家語言模型,總參數 160 億但每次僅啟用 28 億,在 Instinct MI300X/MI325X GPU 上從頭訓練。該模型基線平均分數 76.7,領先其他完全開源的同級模型,但權重採用 ResearchRAIL 授權僅限學術與研究用途,訓練程式碼則以 MIT 授權發布。
AMD 正式釋出 Instella-MoE-16B-A3B,這是一款採用混合專家(MoE)架構的全開源大型語言模型,從零開始在 AMD Instinct MI300X 與 MI325X GPU 上完成訓練。該模型擁有 160 億(16B)總參數,但每次推理僅啟用約 28 億(2.8B)參數,屬於典型的稀疏啟用設計。AMD 不僅公開了模型在每個訓練階段的權重,還一併釋出資料混合配方、訓練配置與推論程式碼,讓研究社群能夠完整重現訓練流程。
在系統層級,Instella-MoE 引入了兩項關鍵技術:Gated Multi-head Latent Attention(Gated MLA)與 FarSkip-Collective 連線機制。Gated MLA 在傳統的多頭潛在注意力(MLA)之上加入一個輕量級學習型輸出閘門,透過一個專屬線性投影根據輸入條件產生閘門值,並在輸出投影前以乘法方式作用,有助於動態調節注意力流向。FarSkip-Collective 則將過時且部分的中間激活值傳遞至 MoE 與注意力層,使專家並行通訊能與計算重疊,從而降低延遲。AMD 報告指出,這兩項技術合計可帶來 12.
7% 的預訓練加速,並在採用專家並行服務時,將首個 token 生成時間(TTFT)最多降低 39.2%。Instella-MoE 採用純解碼器架構,共 27 層,隱藏層大小為 2048,16 個注意力頭,詞彙表大小為 128,896。每個 MoE 層包含 2 個共享專家與 6 個路由專家(從 64 個候選專家中選出),因此活躍參數僅 2.8B,總參數 16B。預訓練與中訓練階段還使用了多 token 預測(Multi-Token Prediction)目標函數,以提升學習效率。訓練管線分為四個階段。預訓練階段使用 7.1 兆(7.
1T)token,資料來源涵蓋 Nemotron-CC-v2、MegaMath、FineMath、RefineCode 與 TxT360 等開放語料庫。中訓練階段則採用 Dolma3 Dolmino 100B 語料庫,並以三種資料變體透過權重平均合併完成。長上下文延伸階段將視窗從 4K 擴展至 64K,使用 YaRN 插值、提高 RoPE 的 theta 值,並引入文件遮罩(document masking)技術。後訓練階段則先以 Dolci-Think-SFT-7B 加上 Nemotron 混合資料進行監督微調(SFT),再透過一個包含 512K 範例的弱點回饋資料集進行針對性改善。
隨後進行直接偏好最佳化(DPO),過程中停用路由器偏移更新與輔助負載平衡損失,以避免性能退化。最後,在 Miles 框架中執行強化學習:先進行 1,400 步的指令遵循 RLVR,再透過多教師同策略蒸餾(Multi-Teacher On-Policy Distillation)將強化學習成果回饋至模型,同時不損害數學與程式碼能力。在基準測試方面,Instella-MoE 的基礎檢查點平均得分為 76.7,在所有完全開源模型中表現最佳,領先 Moonlight-16B-A3B(76.2)、SmolLM3-3B-Base(70.5)、OLMo-3-7B(70.1)與 OLMoE-1B-7B(61.
9)。不過仍落後於 Qwen3.5-4B-Base(79.5)。在特定任務上,WinoGrande 得分 86.5,HumanEval+ 得分 65.7。長上下文方面,HELMET 平均 41.5,RULER 平均 79.4。後訓練階段得分從 SFT 的 71.58 提升至 DPO 的 72.67,再提升至 Think 階段的 73.22,超越 Olmo3-7B-Think(71.97)、Gemma-4-E4B think(70.47)與 Qwen3.5-4B(69.73)。IFEval 指標則從 77.08 上升至 83.70。
部署方面,Instella-MoE 的權重採用 ResearchRAIL 授權,僅限學術與研究用途,並非可直接商用的模型。訓練程式碼庫則以 MIT 授權釋出,這部分具有更高的重複利用價值。模型本身在 BF16 精度下,160 億參數約需 32 GB 權重記憶體,因此單張高記憶體加速器即可執行。AMD 同時提供 SGLang 推論程式碼,方便研究人員進行部署與測試。此模型適合的對象包括 AI 研究實驗室、大學研究團隊以及具備資料中心 GPU 資源的企業研發部門;對於希望使用託管商業端點的精簡新創公司來說,則較不適合。相關產業包含半導體與雲端基礎設施、AI 工具供應商以及學術研究領域。
潛在應用包括復現端到端的 MoE 訓練流程、研究專家並行服務(expert-parallel serving)、評估 64K 長上下文行為,以及執行強化學習後訓練實驗。詳細資訊可參考 AMD ROCm 部落格、Hugging Face 模型集與 GitHub 儲存庫。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。