騰訊開源 AngelSpec 框架:破解大模型真實推理效率難題
重點摘要
AI資訊AI新閒資訊正文騰訊開源 AngelSpec 框架:破解大模型真實推理效率難題發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘在當前大模型規模與服務需求持續增長的背景下,如何降低自迴歸解碼的高昂成本成為了行業的一大痛點。為此,騰訊技術團隊正式開源了統訓框架AngelSpec,旨在通過多方案協同與工作負載異構適配,全面提升大模型在真實場景中的推理吞吐量。
# 騰訊開源 AngelSpec 框架:破解大模型真實推理效率難題,為產業落地提供關鍵支撐
在當前大模型規模持續膨脹、服務需求急劇增長的背景下,如何有效降低自迴歸解碼帶來的高昂計算成本,已成為制約人工智慧技術廣泛應用的核心瓶頸。為應對這一行業性挑戰,騰訊技術團隊於近日正式開源了全新統一訓練推理框架 AngelSpec,旨在通過多方案協同與工作負載異構適配,全面提升大模型在真實場景中的推理吞吐量,為大規模模型部署與服務優化提供了全新的解決思路。 ## 推理效率困境:自迴歸解碼成本成產業落地最大障礙
隨著大型語言模型在對話系統、程式碼生成、數學推理等領域展現出驚人能力,業界對模型服務的需求呈現爆發式增長。然而,傳統的自迴歸解碼方式——即逐個token依序生成——雖然在生成品質上有保障,卻因無法充分利用現代硬體的平行計算能力,導致推理延遲高、吞吐量低,尤其在處理長序列與高並發請求時,計算成本急遽攀升。近期包括Kimi等多家頭部AI服務商因算力緊缺而被迫暫停新用戶訂閱,正是這一困境的鮮明縮影。在這樣的產業背景下,騰訊推出的AngelSpec框架可謂及時雨。 ## 分而治之:針對不同場景打造差異化訓練策略
AngelSpec框架最核心的設計理念,在於認識到不同應用場景下文本特徵存在根本性差異,因此採取「分而治之」的策略。針對高熵、開放式的多輪對話任務——這類任務通常具有高度的不確定性與創意空間——系統採用輕量且穩定的多token預測機制(MTP)。該機制不僅突破了傳統逐token生成的效率瓶頸,更結合訓練時測試(TTT)與端到端總變差損失(Total Variation Loss),使模型能夠有效適應自迴歸展開中的狀態分佈變化,在保持對話流暢性與多樣性的同時,大幅提升生成速度。 而面對結構約束更強的程式碼生成與數學推理任務,AngelSpec則採取了截然不同的策略。這類任務往往遵循嚴格的語法規則和邏輯結構,序列中存在大量可預測的長跨度依賴關係。為此,框架透過專有的塊擴散模型(Block Diffusion Model)進行強化訓練,充分挖掘長跨度可預測序列的潛力,從而在保證生成結果精確性的前提下,實現更大規模的平行解碼。 ## DFly架構創新:塊擴散框架重新定義生成效率
在架構設計上,AngelSpec框架提出了名為 DFly 的創新塊擴散框架,這可謂是本次開源項目中最具技術亮點的核心組件。DFly 透過混合目標條件編碼骨幹與前序條件自迴歸頭,在保持高吞吐量並行生成的同時,大幅優化了目標特徵利用率與塊內依賴建模能力。傳統的平行解碼方法往往在加快速度的同時犧牲了生成品質,而DFly透過獨特的混合架構設計,有效地在效率與品質之間找到了最佳平衡點。 具體而言,DFly的目標條件編碼骨幹能夠讓模型在生成過程中更好地理解整體上下文與目標特徵,而前序條件自迴歸頭則確保了在同一塊內部的token生成仍然能夠捕捉到細粒度的序列依賴關係。這種「宏觀平行、微觀序列」的架構設計,使得DFly在處理長文本生成任務時,能夠達到數倍於原始解碼速度的吞吐量提升,同時不犧牲生成文本的邏輯一致性與內容品質。 ## 動態驗證機制:即時調度實現算力與效率的最佳平衡
除了靜態的框架設計外,AngelSpec還引入了一套高度智慧的動態驗證機制。該機制可結合當前在線負載、硬體條件及前綴置信度,在運行時自適應調整驗證深度。換言之,系統不再使用固定的驗證策略,而是根據實際運作環境的即時狀態,動態決定需要對生成結果進行多嚴格的校驗。 當系統負載較低或硬體資源充裕時,動態驗證機制會採用更嚴格的標準,確保生成品質達到最高水平;而當遇到高併發請求或資源受限的情況時,系統則會在保證可接受品質的前提下,適度降低驗證深度,從而優先保障服務的響應速度與吞吐量。這種靈活的設計不僅避免了傳統方案中「一刀切」導致的資源浪費,更使得AngelSpec能夠在多樣化的部署環境中都能展現出色的性能表現。 ## 性能實測:Hy3模型系列展現壓倒性吞吐優勢
AngelSpec框架的實際效果並非僅停留在理論層面。根據騰訊技術團隊發佈的論文顯示,在 Hy3 模型系列的系統測試中,搭載 DFly 方案的系統展現出了顯著的性能優勢。測試覆蓋了從4到64的不同並發數場景,DFly方案在所有測試條件下均實現了最高平均吞吐量。特別是在高並發場景下,相較於傳統的自迴歸解碼方式,搭載AngelSpec框架的系統吞吐量提升尤為顯著,為大模型的工程化落地與高效推理提供了堅實的技術支撐。 這項測試結果的意義不僅在於數字上的提升,更在於證明了大模型推理效率可以透過框架層面的創新實現質的飛躍,而非單純依賴硬體升級或模型小型化。對於已經投入大量資源部署大模型服務的企業而言,AngelSpec框架的開源無疑提供了一個極具吸引力的低成本優化方案。 ## 開源生態:騰訊推動AI基礎設施共建共享
作為本次開源行動的重要組成部分,騰訊已將 AngelSpec 框架的完整程式碼上傳至 GitHub 平台,並同步發表了相關技術論文,供全球開發者與研究人員查閱與使用。這種全面開源的做法,不僅展現了騰訊在AI基礎設施建設上的開放態度,更為整個行業提供了一個可供參考與二次開發的基礎平台。 值得注意的是,AngelSpec的開源時機恰逢業界對推理效率問題的關注度達到新高。近期,中國電信將大模型應用於5G無線網路規劃,規劃效率提升50%;騰訊WorkBuddy月訪問量突破2000萬,領跑AI辦公智能體市場。這些案例都表明,大模型正在快速滲透各行各業,而推理效率作為決定應用成敗的關鍵因素,其重要性也隨之水漲船高。AngelSpec的出現,為正在尋求高效推理解決方案的開發者與企業提供了一個強而有力的工具。 ## 行業影響:重新定義大模型服務成本結構
從更宏觀的視角來看,AngelSpec框架的開源將對整個AI產業產生深遠影響。當推理效率提升數倍甚至數十倍時,大模型服務的單位成本將大幅下降。這意味著過去因算力成本過高而無法商業化的應用場景,有望在短期內變得可行。對於中小型企業和新創團隊而言,高效推理框架的普及將大幅降低他們進入大模型應用的門檻,從而激發更多的創新應用誕生。 同時,AngelSpec所採用的「因場景制宜」的設計哲學,也為後續的推理優化研究樹立了新的標竿。過去,學術界與工業界往往試圖尋找一種「放諸四海而皆準」的通用解決方案。而AngelSpec的實踐證明了,針對不同任務特點設計差異化的優化策略,往往能夠取得更好的整體效果。這種思路的轉變,可能會引發一波針對細分場景推理優化的研究熱潮。 ## 未來展望:從模型能力競賽走向效率與體驗的綜合比拼
隨著AngelSpec等高效推理框架的普及,大模型領域的競爭格局也將發生微妙變化。過去幾年,業界的焦點主要集中在模型規模與能力邊界的拓展上,各家廠商爭相推出參數量更大的模型。然而,當模型能力逐漸趨近天花板時,如何以更低的成本、更快的速度提供服務,將成為決定市場競爭力的核心因素。 換言之,行業正在從單純的「模型能力競賽」轉向「能力、效率與用戶體驗」的綜合比拼。AngelSpec的開源,無疑為騰訊在這一新賽道中搶佔了先機。而對於整個AI生態而言,高效推理框架的成熟將加速大模型在實際業務中的落地,推動人工智慧技術從「實驗室奇蹟」真正轉變為「可規模化應用的生產力工具」。 隨著開發者社群對AngelSpec的深入研究與持續貢獻,這一框架有望在未來持續進化,為更多場景提供更優化的推理解決方案。而騰訊此次全面開源的姿態,也將為中國AI基礎設施的開放生態建設注入新的活力,推動整個行業朝向更加高效、普惠的方向發展。
Related
相關文章

剛剛,OpenAI硬件路線圖曝光:先音箱後手機
OpenAI 的硬體布局終於有了更清晰的輪廓。根據最新曝光的產品路線圖,這家 AI 巨頭並不打算急著推出備受期待的智慧型手機,而是先從一款能夠在家裡自由移動的無螢幕智慧音箱下手。這項策略背後,其實反映了 OpenAI 想要讓 AI 真正融入日常生活,而非僅停留在手機應用程式的野心。 據了解,OpenAI 在一年前斥資 65 億美元收購了由知名設計師 Jony Ive 創辦的公司 io,之後便開始積極籌劃自有硬體產品。

2026年中國工業具身智能行業發展研究報告(上)
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作2026年中國工業具身智能行業發展研究報告(上)艾瑞諮詢·2026年07月30日 08:45工業具身智能產業發展及落地路徑分析 摘要 工業具身智能的興起,源於工業需求與技術能力的共同變化。 製造業正從大批量、固定流程生產,走向多品種、小批量、柔性化生產,傳統工業機器人在非結構化環境、複雜任務理解和動態適應方面仍存在侷限。與此同時,多模態感知、智能決策、運動控制、仿真訓練與機器人本體技術持續進步,為智能系統進入真實工業現場創造了條件。因此,工業具身智能並非簡單新增一種機器人品類,而是圍繞真實工業任務,將感知、決策、執行、反饋與迭代組織成閉環的現場智能系統。 技術競爭不再只看單點能力突破,而是轉向任務閉環中的系統協同。 工業具身智能不等同於人形機器人,也不由單一本體形態或模型能力定義;固定操作、移動感知、移動操作、廠內物流、產線流轉等載體將按任務長期並存。當前感知、控制和執行等模塊已有一定產業基礎,但複雜任務理解、異常處理、跨場景泛化和持續學習仍處發展階段。技術能否形成產業價值,關鍵在於能否支撐真實工業任務穩定運行、結果驗證、異常恢復和持續優化。 工業具身智能不會在所有場景同步放量,而將從高價值、可閉環任務率先突破。

賈揚清再創業,造了一支AI軍團,讓GLM-5.2提速534%
好的,這是一篇基於您提供資料重寫的完整新聞稿。 --- ## AI大牛賈揚清再創業「造軍團」,祭出三大殺手鐧,GLM-5.2推理速度狂飆534% AI領域的傳奇人物賈揚清再次成為業界焦點。這位阿里雲前副總裁、Lepton AI創始人,在告別英偉達約一個月後,迅速啟動了新一輪創業項目「Intent Lab」,並組建了一支名為「Fleet」的自主AI團隊,目標是將使用者的模糊意圖直接轉化為可上線的生產級軟體系統,挑戰AI在軟體工程領域的能力邊界。

影視颶風日賺500萬,李一舟捲土重來,49元AI課“割”瘋了?
影視颶風推出49元AI實戰課,上線當天即熱銷10萬份,日收入近500萬元,但被網友質疑內容像廣告、含金量低,屬於「割韭菜」。與此同時,初代AI教父李一舟也以49元低價課捲土重來,再透過私域推銷1980元年費課程,引發爭議。整體而言,AI知識付費市場雖持續增長,但多次割韭菜行為已讓用戶對該領域信任度下降。

楊植麟終於追上梁文鋒了
# 杨植麟终于追上梁文锋了:中国开源大模型双雄格局初成 2026年7月30日,一则消息引爆了全球AI圈——月之暗面(Kimi)正式开源了K3模型权重。这个拥有2.8万亿总参数、性能接近全球最顶级模型Claude Fable 5的大模型,以完全免费下载、本地部署、自由商用的姿态,向世界展示了中国AI力量的又一次跃升。 这不仅仅是一次技术发布。它标志着中国两大独立大模型公司——DeepSeek和Kimi——在技术与影响力的赛道上,终于站到了并肩的位置。

Edge AI Daily 早報(7月30日)
Edge AI Daily 早報(7月30日)Edge AI Daily2026.07.30 08:06 · 來自北京全文4139字00:00 / 11:24Meta資本支出飆升至1250-1450億美元,標誌互聯網公司向AI基礎設施重資產轉型。