AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs
重點摘要
AMD 發布 Instella-MoE-16B-A3B,一個完全開放的混合專家語言模型,總參數 160 億但每次僅啟用 28 億,在 Instinct MI300X/MI325X GPU 上從頭訓練。該模型基線平均分數 76.7,領先其他完全開源的同級模型,但權重採用 ResearchRAIL 授權僅限學術與研究用途,訓練程式碼則以 MIT 授權發布。
AMD 正式釋出 Instella-MoE-16B-A3B,這是一款採用混合專家(MoE)架構的全開源大型語言模型,從零開始在 AMD Instinct MI300X 與 MI325X GPU 上完成訓練。該模型擁有 160 億(16B)總參數,但每次推理僅啟用約 28 億(2.8B)參數,屬於典型的稀疏啟用設計。AMD 不僅公開了模型在每個訓練階段的權重,還一併釋出資料混合配方、訓練配置與推論程式碼,讓研究社群能夠完整重現訓練流程。 在系統層級,Instella-MoE 引入了兩項關鍵技術:Gated Multi-head Latent Attention(Gated MLA)與 FarSkip-Collective 連線機制。Gated MLA 在傳統的多頭潛在注意力(MLA)之上加入一個輕量級學習型輸出閘門,透過一個專屬線性投影根據輸入條件產生閘門值,並在輸出投影前以乘法方式作用,有助於動態調節注意力流向。FarSkip-Collective 則將過時且部分的中間激活值傳遞至 MoE 與注意力層,使專家並行通訊能與計算重疊,從而降低延遲。AMD 報告指出,這兩項技術合計可帶來 12.7% 的預訓練加速,並在採用專家並行服務時,將首個 token 生成時間(TTFT)最多降低 39.2%。 Instella-MoE 採用純解碼器架構,共 27 層,隱藏層大小為 2048,16 個注意力頭,詞彙表大小為 128,896。每個 MoE 層包含 2 個共享專家與 6 個路由專家(從 64 個候選專家中選出),因此活躍參數僅 2.8B,總參數 16B。預訓練與中訓練階段還使用了多 token 預測(Multi-Token Prediction)目標函數,以提升學習效率。 訓練管線分為四個階段。預訓練階段使用 7.1 兆(7.1T)token,資料來源涵蓋 Nemotron-CC-v2、MegaMath、FineMath、RefineCode 與 TxT360 等開放語料庫。中訓練階段則採用 Dolma3 Dolmino 100B 語料庫,並以三種資料變體透過權重平均合併完成。長上下文延伸階段將視窗從 4K 擴展至 64K,使用 YaRN 插值、提高 RoPE 的 theta 值,並引入文件遮罩(document masking)技術。後訓練階段則先以 Dolci-Think-SFT-7B 加上 Nemotron 混合資料進行監督微調(SFT),再透過一個包含 512K 範例的弱點回饋資料集進行針對性改善。隨後進行直接偏好最佳化(DPO),過程中停用路由器偏移更新與輔助負載平衡損失,以避免性能退化。最後,在 Miles 框架中執行強化學習:先進行 1,400 步的指令遵循 RLVR,再透過多教師同策略蒸餾(Multi-Teacher On-Policy Distillation)將強化學習成果回饋至模型,同時不損害數學與程式碼能力。 在基準測試方面,Instella-MoE 的基礎檢查點平均得分為 76.7,在所有完全開源模型中表現最佳,領先 Moonlight-16B-A3B(76.2)、SmolLM3-3B-Base(70.5)、OLMo-3-7B(70.1)與 OLMoE-1B-7B(61.9)。不過仍落後於 Qwen3.5-4B-Base(79.5)。在特定任務上,WinoGrande 得分 86.5,HumanEval+ 得分 65.7。長上下文方面,HELMET 平均 41.5,RULER 平均 79.4。後訓練階段得分從 SFT 的 71.58 提升至 DPO 的 72.67,再提升至 Think 階段的 73.22,超越 Olmo3-7B-Think(71.97)、Gemma-4-E4B think(70.47)與 Qwen3.5-4B(69.73)。IFEval 指標則從 77.08 上升至 83.70。 部署方面,Instella-MoE 的權重採用 ResearchRAIL 授權,僅限學術與研究用途,並非可直接商用的模型。訓練程式碼庫則以 MIT 授權釋出,這部分具有更高的重複利用價值。模型本身在 BF16 精度下,160 億參數約需 32 GB 權重記憶體,因此單張高記憶體加速器即可執行。AMD 同時提供 SGLang 推論程式碼,方便研究人員進行部署與測試。此模型適合的對象包括 AI 研究實驗室、大學研究團隊以及具備資料中心 GPU 資源的企業研發部門;對於希望使用託管商業端點的精簡新創公司來說,則較不適合。相關產業包含半導體與雲端基礎設施、AI 工具供應商以及學術研究領域。潛在應用包括復現端到端的 MoE 訓練流程、研究專家並行服務(expert-parallel serving)、評估 64K 長上下文行為,以及執行強化學習後訓練實驗。 詳細資訊可參考 AMD ROCm 部落格、Hugging Face 模型集與 GitHub 儲存庫。
Related
相關文章
利用 NVIDIA Transformer Engine、融合內核、BF16、FP8 與 GPU 基準測試加速 Transformer 訓練
在本教學中,我們探討 NVIDIA Transformer Engine 如何透過結合融合 GPU 內核、BF16 計算與硬體感知的 FP8 執行來加速 Transformer 工作負載。我們首先安裝 Transformer Engine 並檢測活躍的 GPU 架構,以判斷執行環境是否支援 TE 內核、FP8 張量核心,或僅能使用純 PyTorch 回退路徑。接著,我們檢視核心融合元件,如 te.Linear、te.LayerNorm、te.LayerNormLinear、te.LayerNormMLP 和 te.TransformerLayer,同時配置一個延遲縮放 FP8 配方,以管理張量縮放、amax 歷史記錄與混合 E4M3/E5M2 格式。利用這些元件,我們建構一個精簡的 GPT 風格因果語言模型,在確定性的合成序列上進行訓練,並比較高精度與 FP8 的效能差異。
Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks
Supabase has open sourced Supabase Evals, its benchmark and framework for testing how well AI agents build using Supabase.
深度求索發佈閃電模型更新
Ad Skip to content All Topics AI and society AI in practice AI research Frontier Radar Short News Read full article about: Google Deepmind unveils Gemini Robotics 2 to power robots of all shapes from tabletop arms to humanoids Google Deepmind has introduced Gemini Robotics 2, which it calls its most advanced vision-language-action (VLA) model yet. VLA models combine image recognition, language processing, and action control to help robots operate in physical environments. Deepmind says the model can control systems ranging from tabletop arms to full-body humanoid robots. The company describes Gemini Robotics 2 as an "intelligence layer" for a new generation of adaptive robots. It can manage full-body movement, perform fine motor tasks, and coordinate multiple robots, according to Deepmind.
潛推理推薦模型實現大幅提速
研究團隊提出潛在推理推薦框架WhisperRec,將教師生成的鏈式思考壓縮為可學習的潛在推理token,避免顯式推理的延遲瓶頸。實驗顯示,WhisperRec在工業級快手資料集與公開基準上,其SID@64指標較顯式CoT方法提升17.44%,且線上推論吞吐量提升超過10倍。
新型控制器優化大模型搜索成本
大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。
前特斯拉大牛探討編程範式轉變
前特斯拉大牛探討編程範式轉變。 專家聲稱傳統編程正被大模型徹底顛覆。用戶在紅迪討論貼中可細讀現場觀點。他認為上下文窗口已成了新的控制槓桿。很多開發者仍用老標準衡量自身價值。這一趨勢讓不少資深程序員 ��� 感到焦慮。