MarkTechPost AI模型更新

Tencent Open-Sources AngelSpec: A Unified Training Framework for MTP and Block-Parallel Speculative Decoding on Hy3 Models

2026年7月30日 10:08

重點摘要

Tencent has released AngelSpec, an open-source, torch-native training framework for speculative-decoding draft models.

站內 AI 整理稿

騰訊正式開源了名為 AngelSpec 的訓練框架,這是一套專為推測解碼(Speculative Decoding)設計的草稿模型訓練工具,原生支援 PyTorch,並涵蓋自回歸多 token 預測(MTP)與區塊並行 DFlash 系列模型。此框架將實際推論服務中的工作負載異質性視為首要設計考量,而非僅追求單一模型在平均基準上的最佳表現。 推測解碼技術能在不影響輸出品質的前提下大幅加速大型語言模型的推論速度,其運作原理是由一個輕量的草稿模型先提出數個未來 token,再由主目標模型以一次前向傳播透過拒絕採樣進行驗證。加速效果取決於兩個因素:有多少草稿 token 被接受,以及完整的「草稿-驗證」流程耗時多久。然而這兩個因素在不同領域中呈現相反趨勢:在高熵的開放式對話中,許多延續語句在語意上都合理,目標模型可能接受其中任何一個,因此接受率會隨著草稿深度快速下降,產生與驗證長區塊的代價反而浪費算力;而在程式碼與數學推理中,語法結構與形式化推導對後續 token 的限制更強,往往能產生較長的可預測區段,恰好適合區塊並行草稿。 為了解決單一通用草稿模型無法兼顧兩種負載的問題,AngelSpec 提供了兩個互補的草稿模型,而非一個妥協版本。MTP 模型使用豐富且多元的對話資料進行訓練,專為對話場景設計;區塊擴散模型則透過以程式碼和數學為主的樣本強化訓練,專攻結構化內容。這種分工讓每個模型都能在各自領域發揮最佳效果。 針對 MTP 路徑,原始 Hy3 模型在訓練時只使用單一 MTP 層且沒有反覆的自條件展開,導致推論時重複使用同一區塊時,錯誤會隨著深度累積,第二、第三個草稿位置的接受率明顯低於第一個。AngelSpec 提出了共享參數多深度方案來彌合訓練與推論之間的落差:保留 D 個邏輯預測深度,但只重用一個實體 MTP 區塊,在訓練時將該區塊自回歸展開 D 步,每一步的預測作為下一步的輸入。遵循 EAGLE-3 提出的「訓練時測試」原則,深度 k+1 接收的是深度 k 的 arg max 預測而非真實 token;參數共享,但監督訊號仍按深度區分,讓目標模型在每個深度前移一個未來位置。 此外,MTP 訓練採用了兩項關鍵設計:第一,凍結目標模型的主幹與語言模型頭,並將來自主幹的 MTP 輸入進行梯度截斷,讓草稿模型改善提案分佈時不影響驗證所需的分佈。第二,使用目標模型真實生成的回應進行訓練,而非原始參考語料庫中的資料,這樣草稿模型在服務階段必須逼近的 token 選擇、隱藏狀態軌跡及局部不確定性模式都能在訓練時完整重現。在貪婪解碼設定下,平均接受率從 52.8% 提升至 66.4%,平均接受長度從 2.58 增加到 2.99;第一個位置的接受率大致持平,而更深位置的改善尤為顯著,例如 GSM8K 上第三位置接受率從 0.290 升至 0.706,HumanEval 上則從 0.387 升至 0.757。 區塊擴散架構 DFly 則建立在 DFlash 之上,並引入兩項結構性改進。首先是混合目標條件化骨幹:DFlash 將多個目標層的隱藏狀態拼接並經全連接層轉換,產生一個共享的上下文特徵提供給所有草稿層,這限制了各層的專化能力;DFly 繼承了 DFlash 的全連接分支以建立共同的語義基礎,同時引入每個草稿層專屬的融合權重,作為殘差修正,額外增加的權重數量只有 D × T 個標量,且 softmax 係數可在訓練後預先計算。其次是前驅條件化自回歸頭:並行骨幹只能從已接受的上下文預測每個區塊位置,無法得知先前草稿位置實際選擇了哪個延續,這導致後綴接受率衰減;DFly 在並行骨幹後方加入一個小型序列頭,將逐位置的邊際預測轉換為前綴條件化分佈,昂貴的骨幹保持完全並行,只有小型頭部以自左向右方式執行。 在性能表現上,DFly 在 Qwen3-8B 上達到 5.41 的平均接受長度,優於 DSpark(5.32)、DFlash(4.57)與 MTP(3.24),並在五項數學與程式碼基準測試中全數取得最佳結果。在 Hy3-A21B 模型上差距更為明顯,DFly 達到 4.79,相較於 DFlash 的 3.69 與 MTP 的 3.00 分別提升 29.8% 與 59.7%,且在六項基準測試中全面進步。逐步消融實驗顯示,從 DFlash 骨幹(3.77)到 DFly 骨幹(4.40)、加上 Markov 頭(4.56)、隱藏狀態修正(4.60)以及程式碼與數學資料強化(4.75),每一步都帶來可量化的提升。資料擴充部分增加了 70 萬條提示,其中 50 萬條程式碼來自 OpenCodeInstruct 與 OpenCodeReasoning,20 萬條數學題來自 Big-Math,生成回應前已剔除與評估樣本有連續 16 個 token 重疊的提示。 從框架層面來看,AngelSpec 建構在 TorchSpec 之上並進行多處擴展。其基礎架構採用分離式設計:推論引擎執行凍結的目標模型,並透過 Mooncake 支援的 RDMA 儲存將隱藏狀態直接串流給分散式訓練工作節點。隱藏狀態透過公開的 vLLM API(推測隱藏狀態提取鉤子與自訂 KV 連接器)在 vLLM 工作進程內捕獲,無需修改引擎。重要擴展包括:訓練時測試展開以並行方式處理整個序列,透過編譯後的 FlexAttention 與 logsumexp 合併隱式重現因果前綴加對角注意力結構,記憶體開銷接近單次因果傳遞;支援最長 128k token 的長上下文訓練,採用 Ulysses 序列平行化,每個本地分片攜帶 D-token 環以保持深度偏移監督在 rank 內;文件感知的序列打包包含三種隔離機制——注意力文件閘、MTP 路徑專用的深度偏移文件閘,以及文件局部位置編碼,跨文件隔離已通過零注意力洩漏的單元測試驗證;評估伺服器會定期在專用 GPU 上對最新檢查點執行真實推測解碼,回報由服務引擎實際測量的平均接受長度與各位置接受率;框架還提供三層級的可插拔介面:目標(執行期 vLLM 外掛入口點,無需修補原始碼)、目標函數(在共享基礎上組合,透過設定選擇)與最佳化器(Muon 可作為 AdamW 的替代方案)。後端支援依層級區分:vLLM 為一級支援,SGLang 與 HuggingFace Transformers 則屬於社群維護層級。 透過 AngelSpec 的開源,騰訊為學術界與工業界提供了一個可實際用於異質服務流量的推測解碼訓練方案,讓開發者能根據自身應用場景選擇最合適的草稿模型,並在此框架上進一步探索與最佳化。

Related

相關文章

不押注單一AI巨頭,微軟推出MAI系列模型尋找新增長路徑

AI資訊AI新閒資訊正文不押注單一AI巨頭,微軟推出MAI系列模型尋找新增長路徑發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘微軟CEO薩蒂亞·納德拉在最新季度財報電話會議上表示,微軟將推動企業採用多模型架構,並加大自主研發AI模型、智能體及安全產品的投入,以降低對單一前沿AI實驗室的依賴。

10 小時前5900
雷峰網模型更新

越罵越賺?羅技上季度在中國賺翻了,曾罵用戶像狗;智駕「小藍燈」將被禁用!相關國標已啟動制修訂;曝月之暗面完成超35億美元F輪融資

要聞提示1.瀘溪河桃酥被曝疑似吃出“金屬牙冠”,山姆緊急下架2.越罵越賺?羅技上季度在中國賺翻了,曾罵用戶像狗3.智駕“小藍燈”將被禁用!相關國標已啟動制修訂4.曝月之暗面完成超35億美元F輪融資,估值升至500億美元5.美團月付遭批量盜刷,多地用戶中招?回應:或遭遇電信詐騙,正配合警方調查6.業績由盈轉虧!粉筆投資虧損830萬美元,前CEO張小龍曾鼓勵年輕人炒股7.

11 小時前