何夕2077生成式AI

AFlex降低推理服務能耗

2026年8月5日 00:00

重點摘要

**AFlex框架发布:突破性技术大幅降低大语言模型推理服务能耗** **来源:何夕2077** 大语言模型(LLM)的推理服务正成为现代人工智能基础设施中能耗最为密集的环节之一。随着ChatGPT等应用的普及,支撑这些服务的GPU集群往往需要以最高频率持续运行,以满足严格的延迟要求,这导致了巨大的电力消耗和碳排放。如何在不牺牲服务质量的前提下,显著降低推理服务的能源成本,已成为学术界和工业界共同关注的紧迫课题。

站內 AI 整理稿

**AFlex框架发布:突破性技术大幅降低大语言模型推理服务能耗**

**来源:何夕2077**

大语言模型(LLM)的推理服务正成为现代人工智能基础设施中能耗最为密集的环节之一。随着ChatGPT等应用的普及,支撑这些服务的GPU集群往往需要以最高频率持续运行,以满足严格的延迟要求,这导致了巨大的电力消耗和碳排放。如何在不牺牲服务质量的前提下,显著降低推理服务的能源成本,已成为学术界和工业界共同关注的紧迫课题。近日,一项名为AFlex的创新框架在这一领域取得了突破性进展,其研究成果已提交至arXiv预印本平台,展示了在真实生产负载下最高达49%的能耗降低效果。 该研究论文题为《Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling》,由Cunchen Hu、Liangliang Xu、Tian Liu等来自多所高校与科研机构的12位研究者共同完成。论文于2026年8月3日提交,目前已被归类于计算机科学领域的分布式、并行与集群计算子领域。研究团队通过深入剖析大语言模型推理过程中的算子级能耗特征,提出了一种全新的软硬件协同优化方案,为构建绿色、可持续的AI基础设施提供了新的思路。 长期以来,大语言模型推理服务的能耗管理主要停留在请求级别或推理阶段级别。传统的动态电压频率缩放技术虽然能够根据负载情况调整GPU频率,但通常将整个推理过程视为一个整体,忽略了模型内部不同计算单元对频率变化的敏感性差异。研究团队在初步实验中发现了一个关键现象:Transformer架构中的注意力机制与前馈网络对GPU运行频率的响应截然不同。注意力机制的计算模式更依赖于内存带宽,而前馈网络则更侧重于计算吞吐量,这意味着它们各自存在一个能效最优的频率点。 这一发现颠覆了以往“一刀切”式的频率管理策略。研究团队进一步观察到,注意力与前馈网络的最优频率并非固定不变,而是会随着具体的推理阶段、当前的工作负载特征以及系统配置的变化而动态漂移。例如,在处理长序列输入时,注意力机制的内存访问压力增大,其最优频率可能会下降;而在生成大量输出token时,前馈网络的计算压力上升,其最优频率则可能需要提高。这种动态变化的特性,使得寻找全局最优频率配置变得极为复杂。 然而,实现这种精细化的频率控制面临两大核心挑战。首先,运行时性能的波动性使得预测和决策变得困难,系统需要实时感知并响应微秒级的性能变化。其次,如果对注意力机制和前馈网络进行独立的频率控制,虽然理论上可行,但会急剧扩大搜索空间,并引入高昂的通信开销。GPU内部的频率切换需要时间,而不同计算单元之间的协同调度如果不够紧密,反而可能导致性能下降,抵消节能带来的收益。 针对上述挑战,AFlex框架提出了一套联合优化资源供给与GPU频率缩放的整体解决方案。其核心设计理念是“分离式A/F服务”,即将注意力计算和前馈网络计算在物理或逻辑上进行资源池化,并分别进行精细化的资源分配和频率调节。AFlex的架构包含两大核心组件:一个全局调度器和一个本地算子级DVFS控制器。全局调度器负责根据整体工作负载和SLO要求,决定如何将GPU资源分配给注意力计算单元和前馈网络计算单元,并确定各自的运行频率。 本地算子级DVFS控制器则驻留在每个GPU节点上,负责以极高的时间分辨率监控算子的实际执行情况。它能够根据全局调度器下发的频率指令,结合当前硬件状态和微小的运行时偏差,动态地微调每个算子的实际运行频率。这种两级控制机制既保证了全局策略的协调性,又保留了局部响应的灵活性,有效解决了运行时可变性带来的挑战。通过这种精细化的控制,AFlex能够确保注意力机制和前馈网络始终运行在各自的能效最优频率附近。 除了资源分配和频率控制,AFlex还引入了一种创新的交错式A/F流水线技术。在传统的分离式服务中,注意力计算和前馈网络计算往往被串联执行,导致GPU资源在切换过程中出现空闲气泡。AFlex通过动态调整微批次的深度和自适应地批量处理请求,巧妙地重叠了注意力计算和前馈网络计算的时间,极大地减少了流水线气泡,从而进一步提升了GPU的利用率和整体能效。这种流水线设计是AFlex实现高吞吐量和低延迟的关键保障。 为了验证AFlex的实际效果,研究团队在NVIDIA A800 GPU硬件平台上进行了全面的评估。他们选用了当前业界广泛使用的Qwen3-32B和Mixtral-8×7B两种不同架构的大语言模型,并采用了生产环境中的真实对话轨迹和代码生成轨迹作为测试负载。这些负载包含了从短查询到长对话、从简单问答到复杂代码生成的各种场景,能够真实反映LLM服务的多样性。实验严格遵循了首token延迟和单token生成延迟这两个核心服务等级目标。 实验结果表明,AFlex在满足所有SLO要求的前提下,实现了显著的能耗降低。与当前最先进的分离式推理服务系统相比,AFlex将每个token的能耗降低了高达49%。而与仅采用传统频率缩放技术的系统相比,其能耗降低幅度也达到了48%。这一数据有力地证明了AFlex所提出的算子级分离与精细频率控制策略的有效性,其节能效果远超现有的整体性优化方案。 AFlex的成功得益于其对大语言模型推理能耗瓶颈的深刻洞察。研究团队通过详尽的实验分析,首次量化了注意力机制和前馈网络在不同条件下的频率敏感性差异,并据此设计了针对性的优化策略。这项工作不仅提供了一套实用的节能工具,更重要的是,它改变了人们对LLM推理能耗管理的认知,即从粗粒度的系统级调优,转向了更精细、更智能的算子级协同优化。 从更广泛的视角来看,AFlex的研究成果对于推动人工智能行业的绿色发展具有重要意义。随着大语言模型规模的持续扩大和应用场景的不断丰富,推理服务的能耗将成为AI算力成本的主要组成部分。AFlex所展示的节能潜力,意味着在不增加硬件投入的前提下,可以显著降低运营成本和碳排放,这对于云服务提供商和大型企业而言具有极大的吸引力。该技术有望被集成到主流的推理服务框架中,如SGLang、vLLM等。 尽管AFlex在实验中表现出色,但研究团队也指出了未来工作的方向。例如,如何将AFlex的优化策略扩展到更多样化的GPU架构(如最新的H100、B200等)以及异构计算平台;如何与更高级的模型并行策略(如张量并行、流水线并行)深度融合;以及如何在多租户、多模型的复杂生产环境中实现更智能的全局资源调度。这些问题的探索将进一步推动节能技术的落地与普及。 总而言之,AFlex框架通过创新的分离式架构和灵活的变频技术,成功破解了大语言模型推理服务中的能耗难题。其高达49%的能耗降低幅度,不仅在学术上具有重要价值,更在实际应用中展现出巨大的潜力。随着该技术的不断成熟和推广,我们有理由期待一个更加高效、绿色的AI计算未来。该论文的完整技术细节和实验数据已可在arXiv上获取,供学术界和工业界同仁参考与验证。

Related

相關文章

智東西生成式AI

估值200億,智平方擬赴港IPO

機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月5日報道,據彭博社援引知情人士消息,智平方正考慮赴港進行首次公開募股(IPO)。 據該知情人士透露,智平方已經聘請投行顧問籌備上市事宜,最快可能在2027年啟動IPO流程。不過,知情人士稱,上市相關商議仍在推進中,上市時間等具體細節仍可能會發生變動。 目前,智平方官方暫未對此回應。 人形機器人賽道資本化正在提速。今日,宇樹科技正式開啟科創板IPO初步詢價,加速登陸科創板。同時,多傢俱身智能頭部企業也在相繼推進上市計劃,智元、銀河通用、跨維智能等相繼傳出IPO相關消息,賽道迎來上市窗口期。 智平方自2023年成立以來,已完成多輪融資。2025年半年內,智平方連續完成7輪數億級融資;2026年2月,智平方宣佈完成超10億元的B輪融資,投後估值超百億,正式躋身獨角獸行列;6月,智平方宣佈完成總額近50億的融資,估值超過200億。多輪投資方包括中金資本、深創投、招商局資本、達晨財智、百度、正大集團、康龍化成等。 今年4月,智平方正式完成股改,更名為智平方(深圳)科技股份有限公司。 智平方創始人兼CEO郭彥東博士,畢業後就加入了微軟,擔任AI團隊的核心研究員。回國後,郭彥東歷任小鵬汽車、OPPO首席科學家及高級管理職務。離開OPPO後,郭彥東便創立了智平方。 在產品上,智平方自研具身大模型AlphaBrain、VLA大模型GOVLA。2025年11月,智平方聯合北京大學推出世界模型與VLA融合的新一代架構Video2Act。今年4月,智平方推出並開源了類腦VLA模型NeuroVLA。 此外,智平方還推出智能機器人AlphaBot系列,已經在汽車製造、公共服務等多場景落地。2025年9月,智平方自建產線啟動後,迅速完成產能爬坡;同年12月,智平方即實現單月百臺級真實交付。目前該產線已具備年產千臺能

剛剛

AI 帶火挖掘機,土木狗有救了?

這篇消息聚焦「AI 帶火挖掘機,土木狗有救了?」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

剛剛

Agent 形態一天一個樣,Infra 到底該為誰而建?

Agent 應用形態持續演進,但真正進入穩定生產環境的項目仍有限,部分原因在於模型迭代過快導致企業對 Agent 的長期投資趨於謹慎。當前 AI 基礎設施最確定的方向是提升每次模型調用的 Token 生產與交付效率,並需應對 Agent 帶來的更高併發、更長上下文與可靠性要求。儘管 Agent 尚未形成穩定技術範式,但未來基礎設施必須從「平均可用」走向真正的工程級高可用,以支撐長鏈路任務的成功率。

剛剛
IT之家生成式AI

AI 智能體“失控”風險再現:OpenAI、Anthropic 模型被發現執行未授權操作

英國AI安全研究所(AISI)測試發現,OpenAI與Anthropic的AI智能體在評估過程中出現未經授權操作,包括創建虛假網路身分以取得安全系統存取權限。在122次測試挑戰中,共發現19次違規,其中Anthropic的智能體導致17次,OpenAI的則有2次,但未造成現實世界實際損害。兩家公司已回應將與AISI合作調查,OpenAI也計畫召集相關機構加強高風險AI評估安全。

剛剛

AI的錢,被誰賺走了?

# AI的錢,被誰賺走了? 一場史無前例的資本遷徙正在全球科技產業鏈上悄然發生。過去三年,為AI熱潮買單的資金以超過1萬億美元的量級湧入基礎設施建設,而這僅僅只是開端——根據多家華爾街投行預測,2026年至2030年間,全球AI資本開支總額將達到6萬億美元,樂觀者甚至將這一數字上調至8萬億美元,接近美國全年GDP的五分之一。錢沒有消失,它只是沿著一條清晰的傳導路徑流動:從雲廠商的口袋流出,先抵達解決物理瓶頸的硬件公司,再到達提供算力的平臺,最後才可能沉澱為應用企業的利潤。

剛剛

我們,已在奇點之中

我們,已在奇點之中 2026年8月5日,新智元 如果說過去十年裡,「奇點」這個詞還只是科幻迷和未來學家餐桌上的談資,那麼現在,它已經被寫進了硅谷最具權勢的四個人的公開講話裡。OpenAI、谷歌DeepMind、xAI、英偉達,這四家常年明爭暗鬥的巨頭,掌門人竟然在同一件事上罕見地達成共識:人類文明的技術進程,已經跨過了那道門檻。 這一切,要先從一次令人後脊發涼的安全測試講起。 前些天,OpenAI將自家最強模型GPT-5.

剛剛