AFlex降低推理服務能耗
重點摘要
**AFlex框架发布:突破性技术大幅降低大语言模型推理服务能耗** **来源:何夕2077** 大语言模型(LLM)的推理服务正成为现代人工智能基础设施中能耗最为密集的环节之一。随着ChatGPT等应用的普及,支撑这些服务的GPU集群往往需要以最高频率持续运行,以满足严格的延迟要求,这导致了巨大的电力消耗和碳排放。如何在不牺牲服务质量的前提下,显著降低推理服务的能源成本,已成为学术界和工业界共同关注的紧迫课题。
**AFlex框架发布:突破性技术大幅降低大语言模型推理服务能耗**
**来源:何夕2077**
大语言模型(LLM)的推理服务正成为现代人工智能基础设施中能耗最为密集的环节之一。随着ChatGPT等应用的普及,支撑这些服务的GPU集群往往需要以最高频率持续运行,以满足严格的延迟要求,这导致了巨大的电力消耗和碳排放。如何在不牺牲服务质量的前提下,显著降低推理服务的能源成本,已成为学术界和工业界共同关注的紧迫课题。近日,一项名为AFlex的创新框架在这一领域取得了突破性进展,其研究成果已提交至arXiv预印本平台,展示了在真实生产负载下最高达49%的能耗降低效果。
该研究论文题为《Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling》,由Cunchen Hu、Liangliang Xu、Tian Liu等来自多所高校与科研机构的12位研究者共同完成。论文于2026年8月3日提交,目前已被归类于计算机科学领域的分布式、并行与集群计算子领域。研究团队通过深入剖析大语言模型推理过程中的算子级能耗特征,提出了一种全新的软硬件协同优化方案,为构建绿色、可持续的AI基础设施提供了新的思路。
长期以来,大语言模型推理服务的能耗管理主要停留在请求级别或推理阶段级别。传统的动态电压频率缩放技术虽然能够根据负载情况调整GPU频率,但通常将整个推理过程视为一个整体,忽略了模型内部不同计算单元对频率变化的敏感性差异。研究团队在初步实验中发现了一个关键现象:Transformer架构中的注意力机制与前馈网络对GPU运行频率的响应截然不同。注意力机制的计算模式更依赖于内存带宽,而前馈网络则更侧重于计算吞吐量,这意味着它们各自存在一个能效最优的频率点。这一发现颠覆了以往“一刀切”式的频率管理策略。
研究团队进一步观察到,注意力与前馈网络的最优频率并非固定不变,而是会随着具体的推理阶段、当前的工作负载特征以及系统配置的变化而动态漂移。例如,在处理长序列输入时,注意力机制的内存访问压力增大,其最优频率可能会下降;而在生成大量输出token时,前馈网络的计算压力上升,其最优频率则可能需要提高。这种动态变化的特性,使得寻找全局最优频率配置变得极为复杂。然而,实现这种精细化的频率控制面临两大核心挑战。首先,运行时性能的波动性使得预测和决策变得困难,系统需要实时感知并响应微秒级的性能变化。其次,如果对注意力机制和前馈网络进行独立的频率控制,虽然理论上可行,但会急剧扩大搜索空间,并引入高昂的通信开销。
GPU内部的频率切换需要时间,而不同计算单元之间的协同调度如果不够紧密,反而可能导致性能下降,抵消节能带来的收益。针对上述挑战,AFlex框架提出了一套联合优化资源供给与GPU频率缩放的整体解决方案。其核心设计理念是“分离式A/F服务”,即将注意力计算和前馈网络计算在物理或逻辑上进行资源池化,并分别进行精细化的资源分配和频率调节。AFlex的架构包含两大核心组件:一个全局调度器和一个本地算子级DVFS控制器。全局调度器负责根据整体工作负载和SLO要求,决定如何将GPU资源分配给注意力计算单元和前馈网络计算单元,并确定各自的运行频率。
本地算子级DVFS控制器则驻留在每个GPU节点上,负责以极高的时间分辨率监控算子的实际执行情况。它能够根据全局调度器下发的频率指令,结合当前硬件状态和微小的运行时偏差,动态地微调每个算子的实际运行频率。这种两级控制机制既保证了全局策略的协调性,又保留了局部响应的灵活性,有效解决了运行时可变性带来的挑战。通过这种精细化的控制,AFlex能够确保注意力机制和前馈网络始终运行在各自的能效最优频率附近。除了资源分配和频率控制,AFlex还引入了一种创新的交错式A/F流水线技术。在传统的分离式服务中,注意力计算和前馈网络计算往往被串联执行,导致GPU资源在切换过程中出现空闲气泡。
AFlex通过动态调整微批次的深度和自适应地批量处理请求,巧妙地重叠了注意力计算和前馈网络计算的时间,极大地减少了流水线气泡,从而进一步提升了GPU的利用率和整体能效。这种流水线设计是AFlex实现高吞吐量和低延迟的关键保障。为了验证AFlex的实际效果,研究团队在NVIDIA A800 GPU硬件平台上进行了全面的评估。他们选用了当前业界广泛使用的Qwen3-32B和Mixtral-8×7B两种不同架构的大语言模型,并采用了生产环境中的真实对话轨迹和代码生成轨迹作为测试负载。这些负载包含了从短查询到长对话、从简单问答到复杂代码生成的各种场景,能够真实反映LLM服务的多样性。
实验严格遵循了首token延迟和单token生成延迟这两个核心服务等级目标。实验结果表明,AFlex在满足所有SLO要求的前提下,实现了显著的能耗降低。与当前最先进的分离式推理服务系统相比,AFlex将每个token的能耗降低了高达49%。而与仅采用传统频率缩放技术的系统相比,其能耗降低幅度也达到了48%。这一数据有力地证明了AFlex所提出的算子级分离与精细频率控制策略的有效性,其节能效果远超现有的整体性优化方案。AFlex的成功得益于其对大语言模型推理能耗瓶颈的深刻洞察。研究团队通过详尽的实验分析,首次量化了注意力机制和前馈网络在不同条件下的频率敏感性差异,并据此设计了针对性的优化策略。
这项工作不仅提供了一套实用的节能工具,更重要的是,它改变了人们对LLM推理能耗管理的认知,即从粗粒度的系统级调优,转向了更精细、更智能的算子级协同优化。从更广泛的视角来看,AFlex的研究成果对于推动人工智能行业的绿色发展具有重要意义。随着大语言模型规模的持续扩大和应用场景的不断丰富,推理服务的能耗将成为AI算力成本的主要组成部分。AFlex所展示的节能潜力,意味着在不增加硬件投入的前提下,可以显著降低运营成本和碳排放,这对于云服务提供商和大型企业而言具有极大的吸引力。该技术有望被集成到主流的推理服务框架中,如SGLang、vLLM等。
尽管AFlex在实验中表现出色,但研究团队也指出了未来工作的方向。例如,如何将AFlex的优化策略扩展到更多样化的GPU架构(如最新的H100、B200等)以及异构计算平台;如何与更高级的模型并行策略(如张量并行、流水线并行)深度融合;以及如何在多租户、多模型的复杂生产环境中实现更智能的全局资源调度。这些问题的探索将进一步推动节能技术的落地与普及。总而言之,AFlex框架通过创新的分离式架构和灵活的变频技术,成功破解了大语言模型推理服务中的能耗难题。其高达49%的能耗降低幅度,不仅在学术上具有重要价值,更在实际应用中展现出巨大的潜力。
随着该技术的不断成熟和推广,我们有理由期待一个更加高效、绿色的AI计算未来。该论文的完整技术细节和实验数据已可在arXiv上获取,供学术界和工业界同仁参考与验证。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。