通信牆不破,AI Agent算力不立!華為超節點“黑科技”詳解

2026年9月19日 02:51
站內 AI 整理稿

作者 | 李水青 編輯 | 漠影 9月19日報道,在9月17日‑19日舉辦的華為2026年全聯接大會上,華為圍繞靈衢互聯架構及超節點集群,推出昇騰960芯片、昇騰960超節點、OceanStor M900 AI記憶存儲等一系列AI基礎設施新品,引起產業多方關注。其中,“靈衢”成為貫穿所有發佈、高頻出現的關鍵詞,引起了很多人的好奇。靈衢是什麼?有什麼過人之處?華為常務董事、ICT BG CEO楊超斌在主題為“靈衢互聯,架構創新,構建Agentic AI算力底座”的演講中,給出了完整答案。簡單來說,靈衢(UnifiedBus),是華為整個算力底座的統一互聯總線協議。

它把CPU、NPU、DPU、DDR、SSD等多種計算與存儲單元統一互聯起來,並進一步貫穿單機、超節點和超大規模集群。傳統互聯下,十萬卡集群實際算力使用率只有約20%,難以扛住AI Agent時代的計算需求。華為公佈的數據顯示,基於靈衢的單集群可支持100萬顆AI處理器,10萬卡集群的模型浮點算力利用率(MFU)從20%提升至35%。為什麼華為把這次架構創新的關鍵點釘在“通信”上?這要從AI Agent時代的計算需求變化說起。一、通信成AI Agent算力勝負手,三大挑戰“逼”出靈衢架構答案 AI Agent時代,通信正在成為算力“勝負手”。

現在,模型參數規模已經從萬億級走向10萬億級,未來可能進一步達到20萬億甚至50萬億;上下文長度也從幾K級來到幾M級,未來可能達到幾十M。與此同時,人與Agent的交互頻次也遠高於模型。作為AI底層的計算系統,需要同步支持超大模型推理、高頻次調用、多種工具使用、多層級信息傳遞與存儲,面臨諸多挑戰。1、通信量平方級暴漲,10萬卡MFU不足20% 第一個挑戰來自通信範圍極速變大。數據並行域內的通信量與參數量呈近似平方關係,不可掩蓋的通信時間佔比成倍增加,MFU快速下降。典型MoE模型在10萬卡集群上的MFU不到20%。如何打破MFU隨集群規模快速下降的趨勢,成為計算系統面臨的第一道難關。

2、一種算力喂不飽所有AI負載,異構協同與內存池化成剛需 第二個挑戰來自AI業務負載多樣化。Prefill(預填充)與Decode(解碼)呈現出不同的計算特徵與訪存特徵,因此P、D分離,用不同算力來滿足。面向未來更大模型、更低時延的推理,Decode中的Attention與FFN,由於計算與訪存特徵差異,用專用算力來加速可以提升效率。同時,隨著Agent應用普及,CPU與NPU配比發生變化,計算系統需要異構算力協同、內存資源池化,實現動態、高效調整。3、上下文持續變長,舊互聯撐不起多級緩存 第三個挑戰是上下文持續變長帶來的存儲壓力。

無論是訓練還是推理,都必須構建層次化的多級緩存架構,包括HBM、DDR、SSD分層分級,成為必然選擇。現有PCIe加RoCE網絡,難以滿足緩存所需要的時延與帶寬需求。未來PB級的KV Cache,也需要更大的帶寬、更低的時延來匹配。可以說,通信,開始成為計算系統性能的關鍵。它需要超強互聯能力,支持異構算力高效協同和擴容;也需要打破物理極限,實現算力、內存等資源池化;還需要超大帶寬和更低時延,保障計算系統的通信效率。靈衢,就是華為針對這些變化給出的架構答案。

二、一套協議打通芯片到集群,靈衢四大競爭力重裝算力底座 靈衢的核心,是用一套協議貫穿從芯片到集群的整個系統,把複雜協議歸一,統一內存語義,消除協議轉換開銷。楊超斌談道,其競爭力可以概括為以下四個維度: 1、協議歸一,統一內存語義。傳統計算系統採用主從架構,服務器內部CPU和內存可以通過load/store指令直接訪問,但跨節點訪問通常依賴RDMA的Send/Receive消息傳遞。數據需要反覆打包、拆包,還要進行協議轉換。靈衢要做的,就是從協議層重新組織這一過程。

華為將CPU、NPU、DPU、內存、存儲、網卡等核心組件統一基於靈衢協議互聯,實現十幾種協議歸一;同時在超節點內部統一內存語義,實現全局內存統一編址。由此,其互聯帶寬從百GB級提升到TB級,RTT通信時延從7微秒壓縮至2微秒,降低約70%。2、多樣算力,異構協同。CPU、NPU、內存和SSD等計算、存儲單元通過靈衢直接對等互聯,形成去中心化的平等訪問方式。這樣一來,計算系統可以根據不同業務需求靈活配比CPU和NPU,同時具備可擴展性,而不必受制於固定的節點結構。3、分級存儲,全局池化。隨著AI模型不斷變大,單顆芯片、單臺服務器能夠提供的內存容量越來越難滿足需求。

靈衢通過分級存儲和全局池化,將多種混合介質納入統一資源體系,提高內存利用率。4、光電互聯,靈活組網。當超節點從千卡走向萬卡,電互聯開始受到物理距離、帶寬和功耗等限制。華為通過光電互聯構建超高帶寬、超低時延的“數據高速公路”,讓算力能夠從櫃內向跨櫃延伸。以4096卡超節點為例,其需要56個計算櫃和14個靈衢互聯櫃,靈衢最長傳輸距離超過200米。華為通過光路保護、高速光互聯以及176端口、280Tb高速互聯的靈衢交換設備,把單個超節點規模從1024卡擴展到4096卡。

進一步向Scale-Out擴展,4096卡超節點可以作為基本擴展單元,通過1024超大Radix扇出能力、兩層CLOS以及多平面、多軌道拓撲,最終讓單個集群支持100萬顆AI處理器。一位產業鏈人士告訴,過去幾年行業多在既有PCIe加RoCE體系上做優化,但Agent負載把通信、內存、存儲的短板同時放大,繼續在舊協議上疊補丁,收益會越來越小。靈衢等於給AI Agent重裝算力底層邏輯,滿足多樣化算力需求。三、從單櫃到百萬卡,從超節點到一體機,滿足各類Agent需求 基於靈衢,華為進一步構建了一套光電互聯、多樣算力、分級池化的AI Agent超節點集群。

計算、存儲、聯接產品全面支持靈衢,模塊化設計,靈活配置。1、支撐超節點“全家桶”,昇騰960提前登場,狂卷計算效率 會上新發布的Agentic AI超節點集群由鯤鵬950超節點、昇騰960超節點、OceanStor M900記憶存儲、星河UBG交換機組成。整個超節點集群,可以實現靈衢統一協議、多樣化算力靈活擴展、資源分級池化,讓計算效率最優。其中,基於靈衢+NPO光引擎Hi-ONE,單個昇騰960超節點可實現4096卡規模,最大可提供8 EFLOPS FP8的算力,實現高達1PB的HBM容量,系統無故障運行的時間提升1倍,系統可用度可以達到99.8%。

昇騰960風冷超節點和液冷超節點分別將於2027年Q2和Q3上市。2、從單櫃172T到百萬卡:靈衢一統,分層按需彈性擴展 在Scale-Up方向,櫃內靈衢交換刀片支持172T超大帶寬,可實現72個昇騰處理器和18個鯤鵬處理器互聯。華為還通過光互聯減少櫃內電纜,一個4096超節點內單櫃可節省196公里銅纜,超過上海到杭州的距離。跨櫃後,靈衢交換設備擁有176個端口,每個端口達到1.6T,單機實現280T全光互聯。兩層CLOS組網可以構建4096卡超節點,RTT時延低至2微秒。

再向Scale-Out擴展,UBG靈衢網絡交換機擁有1024超大Radix扇出能力,可支持百萬卡超節點集群,支持模型參數向幾十萬億演進。由此,靈衢形成了一套從單櫃、千卡、萬卡到百萬卡的分層分級互聯體系,並能夠按需彈性擴展。3、算力存儲三件套,靈衢融合出1+1+1>3 再看算力與存儲,鯤鵬950超節點的計算刀片提供384個CPU核和6TB內存。單櫃可提供12288個CPU核,支持192TB內存。基於靈衢,鯤鵬超節點可以實現超過150萬核統一調度,以及24000TB內存全局池化、統一編址和統一訪問。昇騰960超節點計算刀片則支持8顆昇騰960 NPU,提供32 PFLOPS FP4算力、4.

5TB統一內存,以及17.9TB/s靈衢互聯帶寬。OceanStor M900則負責記憶存儲。它通過全新的存儲控制器和ASU模組,實現網絡、CPU、盤控芯片“三芯合一”,單ASU模組擁有64TB容量密度,單節點訪問帶寬達到480GB/s。三類硬件通過靈衢統一協議進行靈活配置,實現聯動協同和全局訪問。華為將這種融合效果概括為“1+1+1>3”。4、靈衢下沉一體機:Atlas 650E雙機直連,本地跑萬億模型 而在更大規模集群之外,中小場景同樣在靈衢覆蓋範圍內。大部分企業實際部署仍然需要風冷和輕量化方案,桌面級AI應用也在快速普及。

因此,華為基於靈衢推出從1卡到8卡的系列化、多層級一體機產品和鯤鵬昇騰模組。Atlas 650E可以通過雙機靈衢直連,讓16個NPU進行Full-Mesh組網,無需交換機。兩臺機器可以像一臺一樣運行,支持萬億參數模型,並通過EP16並行切分讓推理吞吐提升40%以上,時延低至10毫秒,讓中小企業也能在本地運行萬億參數大模型,同時保障用戶體驗和數據安全。未來增加到16卡以上,其還可以繼續通過靈衢互聯進行平滑擴容,形成小型超節點,同時支持PD分離部署,實現異構AI算力的高效協同。總的來說,大場景有百萬卡集群,中小場景有一體機,華為要把“靈活算力”打成產業剛需。

四、開源組件加行業算子庫,讓生態夥伴“開箱即用” 靈衢要成為底座,不能只靠硬件。楊超斌在演講中回顧,去年8月5日,華為CANN全面開源開放,至今已躍升為中國開源項目活躍度第一。目前CANN社區月活開發者已經達到5200多人,來自企業、高校等不同群體的開發者持續參與。50多家行業頭部客戶、夥伴及高校科研團隊與昇騰合作,將行業知識和業務經驗融入昇騰,已經打造26個行業專屬算子庫。華為與南方電網、高校及其他夥伴一起,在社區中構建起電力仿真求解、電力負荷預測、電力裝備巡檢等一系列專屬開源算子庫,讓輸電線路巡檢更加精準,讓電網負荷預測更加高效,真正讓AI落地到電力生產一線。

科大訊飛深耕AI大模型與應用技術創新,基於昇騰打造領先AI模型,開發了智能客服、辦公等通用方案,金融、教育、醫療等行業場景化方案,為客戶提供高質量AI解決方案。另一側,則是Agent開發生態。華為正在與DeepSeek Harness、OpenCode、openJiuwen等開源框架協同,打造智能管理系統、推理加速庫、安全框架等Agent插件化組件,並進行全量開源。為了進一步降低開發和部署門檻,華為還與90多家主流開源社區展開合作,覆蓋算子編程、基礎庫搭建、模型訓練微調、推理部署和強化學習等全鏈路場景。可以看到,華為希望最終實現的,是“開箱即用”。這也是所謂“硅基黑土地”戰略的核心邏輯。

結語:算力底座之爭,華為給出“系統級加開放生態”新選擇 AI時代奔湧而來,算力是這場變革的核心基石。楊超斌在演講結尾表示,未來華為將堅持系統級技術創新,面向各行各業,構築系列化算力底座;堅持開源開放、聯合客戶、夥伴和開發者,共建生態,為世界提供新的選擇。從靈衢打破通信牆,到11顆關鍵芯片撐起超節點,再到百萬卡集群與開源生態跨越拐點,華為正以“計算加通信”的垂直整合能力,為10萬億級大模型時代構築算力底座。當算力供給從“硬件變現”走向“生態共贏”,AI基礎設施競爭已升維為體系化能力較量。華為的硅基黑土地,正試圖為智能世界提供另一種堅實選擇。

Related

相關文章

鈦媒體生成式AI

Gemini 4 Pro疑似洩露,“AI減速”又成空話

字母AI2026.09.19 10:54 · 來自北京全文4800字00:00 / 12:44RSI正在逼近,三巨頭誰也沒停。文 | 字母AI前幾個月,OpenAI和Anthropic輪番把旗艦模型往前推,谷歌卻顯得異常安靜。Flash幾乎3週一更,3.6、3.7、3.8連續往前,但代表最高能力上限的Pro遲遲沒有動靜。直到這兩天,大模型盲測競技場Arena裡,突然冒出一個掛著gemini-3.8-flash名字的模型。開發者一上手就發現了不對勁,真正的Gemini 3.

剛剛
鈦媒體生成式AI

豆包手機發售,AI代理進入“終端”競賽

洞見新研社2026.09.19 10:54 · 來自湖南全文4998字00:00 / 14:25手機AI競爭從功能內卷轉向代理決策。文 | 洞見新研社,作者 | 鄭施婧2026年,AI手機正在從旗艦機的加分項變成市場標配。 據Counterpoint Research預測,具備生成式AI能力的智能手機將佔全球出貨量的45%,2027年升至52%。但同一份報告裡還顯示,2026年全球智能手機出貨量預計同比下降13.9%,降至10.8億部,創歷史新低。手機大盤在縮,但是AI手機的需求在漲。

剛剛
鈦媒體生成式AI

關於豆包手機二代,我最關心這10個問題

唐辰同學2026.09.19 10:25 · 來自北京全文9598字00:00 / 26:52豆包學會了“敲門”,不再野蠻硬闖。文 | 唐辰同學9月16日,努比亞NaviX Ultra(下稱豆包手機二代)正式開售,售價5999元起,新機搭載豆包手機助手(消費者版)。

剛剛
鈦媒體生成式AI

AI辦公,自費上班打工人的第一筆“首付”

縱向青年2026.09.19 10:00 · 來自遼寧全文4451字00:00 / 13:02誰能搶佔下打工人的桌面。文 | 縱向青年,作者|肆夕,編輯|李明皿過去一個普通打工人的收入規劃,是三分之一留給房租、三分之一用於日常、三分之一作為存款。

剛剛
量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

5 小時前