一文看懂昇騰超節點:AI Infra已進入系統工程階段

2026年9月21日 21:49
一文看懂昇騰超節點:AI Infra已進入系統工程階段
站內 AI 整理稿

(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

對於訓練週期以月計算的前沿大模型而言,MFU每提升幾個百分點,都可能意味著數天的訓練時間差,以及數千萬元甚至上億元的算力成本變化。為解決這一挑戰,有越來越多的廠商把目光投向一種新的算力組織方式——超節點。與傳統集群把計算卡分散在大量服務器中不同,超節點試圖通過更緊密的互聯、統一的內存空間和更低的通信時延,把數千張卡組織成一個邏輯上的整體。日前發佈的昇騰960超節點,正是這樣一套面向10萬卡時代的超節點工程化方案。一、超節點成必然選擇,統一內存編址是關鍵 從去年開始,“超節點”成為AI算力領域熱度快速攀升的概念。

華為昇騰910C超節點等方案率先引發行業討論,此後,國內算力、服務器等廠商也相繼推出相關產品。一時間,超節點幾乎成了新一代AI算力基礎設施的代名詞。在上週的HC2026大會上,華為副董事長、輪值董事長汪濤更是判斷,隨著大模型邁向10T級參數規模,超節點是AI基礎設施建設的必然選擇。但隨著產品不斷湧現,一個更基礎的問題也隨之而來:到底什麼才是真正的超節點?如果只是把更多服務器放在一起,再通過高速網絡連接起來,那麼它與傳統AI集群究竟有什麼區別?2026年7月,在世界人工智能大會(WAIC)期間,《超節點定義與實踐白皮書》正式發佈。

這份白皮書由鵬城實驗室與全球計算聯盟(GCC)聯合牽頭,38家單位共同參與制定,從行業層面對超節點進行了明確界定。白皮書提出,超節點是一種由多個計算節點通過高效互聯協議緊密連接,並具備跨物理節點統一內存編址能力的計算系統,邏輯上具有“一臺計算機”的特徵。以MoE等主流模型為例,隨著參與計算的計算單元數量不斷增加,模型中間結果需要在大量單元間頻繁交換。集群規模越大,通信和同步帶來的開銷也越明顯。此時,如果計算單元然只是分散在不同服務器中,通過網絡進行數據交換,那麼計算卡數量增加,並不意味著有效算力能夠等比例提升。

換句話說,超節點真正改變的,並不是簡單地把8卡服務器擴展到64卡、1024卡甚至4096卡,而是重新組織計算單元間的連接與協作方式,讓分散的計算資源在硬件和軟件層面更像“一臺機器”。在符合這一架構的系統中,超節點內的算力單元以訪問統一的內存共享池,並通過全局地址空間實現跨物理節點訪問。相比之下,傳統集群中的數據往往需要依賴網絡協議,在不同節點之間進行傳輸。華為馬爾科夫實驗室的仿真結果顯示,在同樣為10萬卡的集群中,由4000卡超節點組成的系統,MFU可達到傳統8卡服務器集群的2.75倍。而符合白皮書所定義架構的產品,已經開始進入規模化應用階段。

截至目前,昇騰910C超節點已部署超過1000套,昇騰950超節點也進入規模商用階段,應用覆蓋互聯網、運營商、金融、教育、醫療等多個行業。從標準定義到產品落地,超節點正在從一個產業概念走向現實。然而,隨著超節點規模一路擴大,卡間需要交換的數據量急劇增加,對帶寬、時延和可靠性的要求也水漲船高,互聯的工程難度開始集中出現。二、把光引擎,搬到算力身邊 目前,大規模AI集群內部主要依賴銅纜進行電互聯,隨著SerDes速率達到224G及以上,傳統電互聯方案開始面臨越來越大的壓力。

速率越高,銅纜中的各類損耗就越明顯,信號傳輸距離也越來越受限;而當數千根高速銅纜被集中在一個高密度系統中,佈線、散熱和維護也會變得更加複雜。於是,行業開始把目光投向“光”。在此之前,數據中心的光互連長期依賴傳統可插拔光模塊方案:光模塊作為一個獨立器件,插在交換設備或計算節點的面板上,信號先沿電路板走線傳送到模塊接口,再在模塊內完成電光轉換、進入光纖。▲可插拔光模塊 可插拔設計的好處在於標準化與可維護,模塊壞了可以單獨更換,這也是它統治數據中心互聯二十餘年的原因。但可插拔方案也有一個先天弱點:電信號從計算單元到模塊,需要經過一段漫長的電路板路徑,隨著速率的提升,這段電走線帶來的問題變得難以忍受。

NPO(Near-Packaged Optics,近封裝光學)試圖改變這一過程。它的思路很直接:把光引擎放到計算單元邊緣,讓電信號儘早轉換成光信號。原本需要通過較長距離電連接傳輸的信號,在距離計算卡更近的位置完成光電轉換,再通過光纖完成更遠距離的高速傳輸。對於超節點而言,這意味著可以在更高帶寬下縮短電連接距離,同時降低互聯功耗和時延,並緩解高密度系統中的佈線與散熱壓力。華為Hi-ONE,就是這一路線的一次工程化嘗試。汪濤稱,這是業界首個量產的NPO產品,是目前行業最大傳輸能力的NPO產品,也是唯一實現內置光源的NPO產品。Hi-ONE擁有高達7.

2Tb/s的帶寬,這一帶寬來自36個200G Lane的集成。1個Hi-ONE模塊,就可以替代9個800G光模塊。對於擁有數千個計算單元的超節點而言,互聯器件本身就是系統複雜度的重要組成部分。如果可以把互聯器件的數量,佈線複雜度、功耗和潛在故障點也會隨之減少。現階段,NPO技術面臨的痛點之一是標準缺位:光引擎貼近計算單元后,封裝形式、接口規格、光源方案均無統一約定,各廠商方案互不兼容,產業鏈難以分工放量,成本居高不下。在產業標準層面,華為在全球光互聯標準組織OIF提出了NPO標準立項的建議,得到了眾多行業夥伴的積極響應,其參與推動的《12.

8Tb/s光電近封裝模塊》標準提案已在OIF立項,未來有望形成6.4T/12.8T近封裝光學模塊的行業標準。三、昇騰960超節點拆解:4096卡如何像一臺計算機工作 如果說超節點定義回答了“什麼是一臺機器”,NPO解決了“機器內部怎麼通信”,那麼昇騰960超節點要回答的,就是這兩件事能否真正組合成一個大規模計算系統。昇騰960超節點基於“靈衢+Hi-ONE”打造,採用正交架構和全液冷設計,並通過靈衢實現內存統一編址,將4096顆算力卡在邏輯上融合成一臺“超級計算機”。具體實現層面,昇騰960超節點使用了約5500個Hi-ONE,替代原本需要的4.8萬個800G光模塊,模塊數量降至約1/9。

光模塊數量減少,可以使整個系統中的連接器件和潛在故障點同步下降,也降低了互聯本身的能耗。同時,昇騰960超節點的正交架構讓計算板與交換板垂直正交、直接互聯,這種設計讓板間互連路徑大幅縮短,損耗更低、信號完整性更好,再疊加全液冷設計,使4096卡這樣的高密度部署成為可能。從規模來看,昇騰960超節點最多可擴展至4096卡,提供8EFLOPS FP8、16EFLOPS FP4算力,以及最高1PB的HBM容量,RTT時延最低可達2微秒。相比上一代昇騰950超節點的1024卡規模,昇騰960將單個超節點的計算卡規模提升至4倍。大模型訓練時,模型權重、梯度、優化器狀態及中間激活值均需加載至顯存。

昇騰960超節點的這些參數,意味著單個超節點能容納的模型體量直接上了一個臺階,跨節點切分帶來的通信開銷有望大幅下降。按照公開數據,昇騰960超節點系統功耗降低超過550千瓦,系統可用度達到99.8%,系統無故障運行時間提升1倍。對於運行十萬卡級集群的企業來說,這些指標最終都會轉化為自身業務效率的提升。到這裡,超節點Scale Up的問題暫時得到了解答:4096張計算卡,可以被組織成一個邏輯上的整體。但更大規模的AI集群顯然不可能只靠一臺4096卡超級計算機完成,新的問題又來了。四、4096卡之後,怎麼把“超級計算機”連起來?

有了4096卡超節點,更大規模的集群要解決的是Scale Out問題——也就是節點之間的互聯。跨過這一步,10萬卡集群才能真正成為現實。這正是靈衢UnifiedBus互聯架構試圖解決的問題。靈衢將十餘種互聯協議統一到靈衢協議體系中,減少不同協議之間的轉換開銷,並將互聯帶寬從百GB級提升至TB級,RTT通信時延從7微秒壓縮至2微秒。基於靈衢,多個昇騰960超節點可以通過靈衢網絡或RoCE連接在一起,進一步構建超節點集群。通過二層CLOS四平面組網,靈衢支持的最大集群規模可達到51.2萬卡;再結合多軌道拓撲技術,最大可支持100萬卡昇騰超節點集群。但超節點集群的挑戰不止於“連得更多”。

更大規模的AI算力集群,不是某一種算力單元的獨角戲,NPU之外,CPU、內存、存儲同樣重要。而傳統體系裡,這些資源各自採用不同的互聯協議,規模越大,協議轉換與跨節點通信的開銷就越突出。正因如此,靈衢試圖進一步打破不同計算資源之間的邊界:在這一體系下,昇騰超節點、鯤鵬超節點、KV緩存集群等不同子系統平等互聯,CPU、NPU、內存和存儲不再是彼此獨立的資源,而是通過統一協議進行通信和協同。這一需求,在AI進入Agent時代後變得更加迫切。一個Agent在運行中,可能同時需要調用模型、啟動沙箱、訪問數據庫、進行向量檢索,在CPU、NPU、內存和存儲之間不斷交換數據。

因此,通算與智算的融合,成為超節點向更大規模基礎設施演進的另一個方向。全新升級的鯤鵬超節點基於靈衢全光組網,最大支持4096節點,形成256TB統一內存池;在Agent場景中,十萬級別沙箱啟動相比傳統服務器方案提升30倍,百億千維複雜向量檢索效率實現倍增。從4096卡的單個超節點,到51.2萬卡乃至100萬卡的集群,算力基礎設施的邊界不斷外擴,而貫穿始終的,是同一套互聯體系。結語:10萬卡之後,AI基礎設施進入“系統工程”時代 回到文章開頭的問題:為什麼 10 萬張卡,沒有 10 萬張卡的算力?因為當計算規模不斷擴大,真正限制有效算力的,已經不只是計算卡本身。

數據移動、結果同步、通信、系統散熱、故障恢復,集群運轉的每一個環節都在影響計算,而其中任何一個環節掉隊,都會拖累整臺“機器”的效率。在HC2026大會上,汪濤反覆強調,如今的AI基礎設施競爭已進展到複雜的、多學科的系統工程階段。在這場較量中,華為“計算+通信”的綜合優勢得到集中體現:從NPU到超節點,從光引擎到統一互聯協議,每一層都指向同一個目標,讓算力真正被用起來。

Related

相關文章

鈦媒體生成式AI

Anew labs,“蒸餾”的行家

醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

剛剛

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上

Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。

剛剛

Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放

針對開發者的實際工作流,桌面端提供內置終端、瀏覽器和 Git 狀態查看等功能,支持直接運行和調試項目、審閱代碼改動,並可關聯 PR 狀態,方便跟蹤代碼評審與合併進度。相關推薦法國興業銀行押注 AI:預計最多省下 6 億歐元成本法國興業銀行稱,AI應用擴大將帶來可觀降本空間,潛在規模約5億至6億歐元,其中已規劃到2029年實現約3.

剛剛

法國興業銀行押注 AI:預計最多省下 6 億歐元成本

這家總部位於巴黎的銀行表示,藉助 AI 實現降本的當前潛在空間介於 5 億至 6 億歐元(約合 38.47 億至 46.16 億元人民幣)之間。其中,到 2029 年為止已經落實規劃的降本規模約為 3.5 億歐元(約合 26.93 億元人民幣)。

剛剛