2026年下半年,算力競賽為何突然轉向超節點?

重點摘要
# 算力競賽突然轉向超節點:一場關於大模型基礎設施的軍備賽 “中國大型互聯網企業會在下半年大量部署超節點方案。”一位算力資深人士向數智前線透露了市場的最新走向。雖然超節點整機價格通常高於同等卡數的普通服務器,“但它的賬算得過來,算力密度更高、空間佔地更小。現在企業必須在有限空間承載更多算力,超節點是個‘大殺器’。”新華三人士補充道。 即便此前沒有採用超節點的DeepSeek,“最近也明確要用,正在議價。”一位雲計算大廠人士告訴數智前線,這具有風向標意義。
# 算力競賽突然轉向超節點:一場關於大模型基礎設施的軍備賽
“中國大型互聯網企業會在下半年大量部署超節點方案。”一位算力資深人士向數智前線透露了市場的最新走向。雖然超節點整機價格通常高於同等卡數的普通服務器,“但它的賬算得過來,算力密度更高、空間佔地更小。現在企業必須在有限空間承載更多算力,超節點是個‘大殺器’。”新華三人士補充道。即便此前沒有採用超節點的DeepSeek,“最近也明確要用,正在議價。”一位雲計算大廠人士告訴數智前線,這具有風向標意義。
這一熱潮在2026世界人工智能大會上表現突出:華為展出了20個機櫃組成的1024卡超節點真機、中科曙光展示了沸騰著冷卻液的640卡超節點,百度天池、阿里雲靈駿真武M890、浪潮信息元腦以及沐曦曦景S600,都被放在各自展臺的突出位置。## 超節點是什麼?為何成為主流?簡單來說,超節點通過高速互聯技術,把大量GPU或加速卡從“多臺服務器”深度整合成邏輯上像一臺“超級計算機”的系統,解決了傳統集群跨機器通信的帶寬和延遲瓶頸,從而大幅提升GPU或加速卡的利用率,帶來單位Token成本的下降。“超節點已成為目前AI Infra建設的一個主流趨勢。”華為資深人士對數智前線說。
一年前,超節點還是少數廠商展示系統能力的旗艦產品;一年後,它正在成為主流算力企業必須參與的軍備賽。“國產超節點從去年推出,目前已發展到可批量落地階段。”百度崑崙芯人士說,“到今年底,每家算力企業基本上都具備交付能力。”
## 誰在造超節點?三大路線浮現
超節點不是新概念了。2024年,英偉達發佈GB200 NVL72,將72顆Blackwell GPU納入一個高速互聯域,推動該架構進入業界視野,但最初需求並不算旺。到2025年,隨著大模型參數暴漲,超節點才成為熱點。國內廠商也早在2024年前後開始做技術預研,最早一批在2025年上市,華為、百度智能雲、浪潮信息、新華三、中興等各家都開始發佈。超節點賽道開始湧入多個玩家。 但各家爭奪的焦點不太一樣,目前似乎形成了三條不同路線:一派不斷擴大單個超節點的規模,一派更強調部署效率和經濟性,還有一派試圖用新的芯片和互聯架構重新定義超節點。 **「大節點派」:追求更大規模的超節點**
華為已向業界展示由20個機櫃組成的1024卡的昇騰950超節點真機,並將在今年第四季度批量交付8192卡超節點,理論上這是該超節點滿配技術上限。華為的判斷是,隨著大模型參數、上下文長度和推理併發量持續增加,單個計算域需要容納更多芯片和更大的內存空間。而其去年推出的384卡超節點已在互聯網、金融、能源、教育和醫療等行業,商用落地750多套,證明了超節點的商業規模部署能力。中科曙光選擇了浸沒式液冷支撐更高密度部署。單機櫃640張加速卡,一臺冷卻設備帶兩個機櫃。由這一超節點構建的十萬卡算力集群曙光8000(登峰),已落地國家超算互聯網鄭州核心節點。
“目前已跑滿了90%,很多需求來自模型訓練,也有AI for Science。”曙光人士告訴數智前線。百度智能雲天池超節點則從256卡向512卡演進,後者將在年底推出。它強調從互聯協議、交換芯片到液冷系統的全棧自研。百度智能雲混合雲部總經理杜海介紹,其超節點已經交付多個萬卡集群。文心5.1重要版本的訓練在全國產集群上完成,能源電力行業支撐80多個行業場景推理,也支撐了自研電力大模型的訓練。**「小節點派」:強調經濟性和實用性**
另一批廠商並不認同“越大越好”。阿里雲推出的靈駿真武M890,以64卡為一個Scale-up單元,再通過Scale-out網絡擴展至更大集群。與多數超節點主要面向私有化部署不同,阿里還將這種算力形態放到公共雲上,客戶不必採購設備,也可以按需調用。 浪潮信息、沐曦也選擇了類似方向。浪潮信息去年推出64卡超節點,今年再推32卡產品。32卡可以支撐萬億大模型推理。浪潮信息副總裁趙帥介紹,“我們自己內部用萬億大模型做AI Coding,效率絕對比用千億大模型好。這就是萬億參數大模型帶來的價值。所以再次推出32卡產品,讓更多企業真正用得起。”沐曦則以單櫃64卡為基礎,強調CUDA生態兼容和向萬卡集群的橫向擴展。 **「第三路徑」:新芯片與新架構的嘗試**
還有一些廠商試圖跳出英偉達GPU或華為加速卡路線,走了第三條路徑。清微智能採用可重構數據流架構,每顆芯片同時承擔計算和數據轉發,芯片之間可直連,無交換機。清微智能產品副總裁陳逸倫告訴數智前線,已推出4096卡、峰值算力為500PFLOPS的超節點。北京某訓練場已部署,內蒙、新疆、浙江的金融行業、國央企也已落地。採用同樣路線的還有7月產品剛剛上市的東方算芯。 此外,摩爾線程也計劃年底伴隨新一代GPU推出相關產品。寒武紀雖然目前沒有超節點,但業界判斷下一代芯片也將推出超節點。至此,國內主要算力芯片、服務器企業,幾乎都已進入這一賽道。 ## 為什麼是今年?三大因素推動爆發
超節點為什麼會在今年爆發?業內認為有三大原因。**第一,模型訓練和推理需求足夠大。**訓練端,模型參數量在飆升。7月Kimi發佈參數達2.8萬億的大模型K3。“下一個春節,模型參數會變成3萬億,再下一個6萬億,在後面是10萬億。而海外中等規模模型參數量已達5萬億。”沐曦CTO楊建博士告訴數智前線。業界通常認為,1萬億參數模型訓練需要約5000張卡,3萬億參數模型大約需要1萬張卡,6萬億需要2萬張卡訓練。解決方案最好是把多個芯片連成一體化去運作。推理端,華為人士舉例,AI Coding場景中,一個任務觸發的操作調用已是幾萬次,複雜長程任務是幾十萬甚至上百萬次。
“這意味著更多併發、更長上下文,這正是超節點大內存池的核心賣點。”從訓推需求比例來看,阿里雲資深人士告訴數智前線,目前線上推理和訓練比已接近5:1~10:1,“1萬張卡裡,大約70%~90%都在做推理,只有少部分在做訓練”。**第二,賬算得過來。**超節點的價格比同樣卡數服務器總價要貴,但客戶算的是總體效能賬。“你不能單看卡的數量,它涉及風火水電基礎設施,超節點更集約。為什麼大企業都去部署超節點,肯定是算得過來這個賬。”新華三人士告訴數智前線。浪潮信息副總裁趙帥曾舉例:“通過超節點,如果推理性能提升10倍,但耗電可能只提升2倍,算下來還有收益的。”
崑崙芯人士介紹,傳統模式下10臺機器的算力相加不等於10,“只能等於6”,超節點通過高速互聯把損耗降到最低,讓更多算力發揮效能。如用超節點做PD分離推理,系統比普通同卡數機器提升30%到50%的性能。 **第三,批量交付節點到了。**“超節點是工程化產物,它包含GPU芯片、存儲、通信、交換、散熱、供電、軟件,不是單一廠商能獨立搞定的。”崑崙芯人士說,“目前,超節點已發展到可批量落地階段了。”另一位人士補充,“無論性能做得怎麼樣,大家都可以把整機交付出來”。 ## 訓練還是推理?超節點的最佳應用場景存分歧
不過,超節點更適合訓練還是推理?各家的說法並不同。華為人士認為,訓練、推理都有價值,萬億參數大模型訓練需要巨大內存池,Agent推理需要海量上下文併發,超節點要具備大內存卡。摩爾線程認為,超節點要面向1萬億到5萬億參數大模型訓練,以及高速推理的tokens工廠場景。而沐曦人士認為,“經過嚴密論證,超節點在推理的Decode階段,也就是逐Token生成答案時,價值更為突出。”清微智能陳逸倫分析,“目前超節點在訓練側跑微調較多,拿它做推理性能更好。”
## 核心分歧:超節點該做多大?爆火之下,超節點技術路線有諸多分歧,目前還沒有標準答案,取決於各企業的技術商業判斷。第一個分歧是規模之爭,超節點應該做多大?是64卡/128卡,還是更大規模?行業分成兩個陣營,這裡說的是超節點Scale-up的規模,就是用高帶寬、低時延互聯,把多少芯片納入一個緊耦合計算域。“小節點派”認為:“在我個人認知裡,64卡就夠了。TP並行、EP並行的最大規模可能就是64卡,剩下的通過PP和DP並行、Scale-out去連起來。你沒必要把單個節點的Scale-up做到足夠大,因為任何通信都有延遲,TP和EP對延遲極度敏感,即便千卡互聯中間幾個微秒的延遲,GPU其實都在等。
”一位人士告訴數智前線,“對時延和穩定性都要有考慮,這是一個工程上的平衡,並不是scale up越大越好。”另一位人士持相同立場,“64到128卡是最經濟的形態,再大就浪費了。”
“大節點派”則主張:進入Agent時代後,萬億參數、百萬Token上下文和海量併發推理下,64/128卡小節點統一內存池太小。64卡更像基礎機櫃單元,適合中小規模模型微調、離線推理;萬億大模型完整訓練、大規模多智能體併發,必須依靠更大規模超節點。## CUDA兼容之爭:自研生態還是兼容路線?第二個核心分歧是CUDA兼容之爭。阿里平頭哥、沐曦、海光等走CUDA兼容路線,代碼遷移成本低。華為昇騰、崑崙芯等走自研生態路線。一位大廠人士對數智前線分析,自研生態雖然遷移成本高,但可控性和長期演進空間更大。他坦誠,也許兩三年後,CUDA兼容就沒有那麼重要了。
“我們迴歸技術第一性,CUDA當年的勝出,是很多人做向量編程,心智負擔很大,而CUDA方案讓人在心智上的耗費極大降低,所以在過去10多年取得成功。但到今天有了Agentic coding後,不一定是人去編程,都走向讓Agent去幹,所以CUDA就不那麼重要了。”
一位華為人士介紹,華為是國內最先支持mxfP8和fp4精度的廠商,mxfP8的可變量比fp8更好。“有人說昇騰從CANN走向了CUDA,其實並不完全正確。”他說,“華為增強了向量處理能力,而英偉達增強了矩陣處理能力,兩家都走向了‘矩陣和向量綜合型’方向。”
## 其他技術分歧與共識
還有其他的分歧,如連接中銅纜與光纖,液冷中的風冷和液冷,尤其是浸沒式液冷,這些新舊技術轉換中,因技術瓶頸、故障率與運維成本產生的矛盾和挑戰,讓業界有不同的技術商業選擇。一個共識是軟硬架構協同。超節點演進與模型技術路線密切相關。國內模型架構如何演進?阿里人士告訴數智前線,國內模型企業Attention正在分化為兩條路線,其中千問GDN、Kimi KDA走向Linear Attention;DeepSeek走Smart Attention(MLA、DSA、CSA),智譜目前也採用DeepSeek 3.2的DSA架構。兩個陣營相對獨立,仍需觀察未來兩三年的演進,這也將影響超節點的硬件適配方向。
浪潮信息董事長彭震最近介紹,過去基礎設施主要沿摩爾定律演進,最近的新進展是軟硬件聯合創新,一端提出新算法,另一端用新介質、硬件和網絡適配,收益顯著。他看到美國企業也在開展類似探索。## 未來展望:真正的競爭才剛開始
在沐曦楊建博士看來,這條賽道“未來二三十年都停不下來”。今年,他已看到一些企業開始用AI參與設計,道路、房屋、機械等設計本質上都屬於知識生產,AI的影響早已超出coding,正在滲透到各行各業。一位大型企業管理者希望,到2027年底實現“白天開會寫規範,下班前交給大模型,第二天看結果”,人負責定義和發現問題,大模型負責求解。目前,AI知識創造的進程,“很多企業還沒開始,因為總經理和董事長還沒有作出對數字員工的定崗決定。”資深人士觀察。這正是AI要滲透的市場。而算力越便宜,行業擴張就越快,“整個鏈條就再也停不下來了”。美國算力約為中國的9倍。超節點正成為這條產業鏈向下延伸的重要算力底座。
隨著更多廠商具備整機交付能力,真正激烈的競爭已經開始。“現在比拼的是能否批量交付、穩定運行,並真正降低每Token成本。”一位大廠人士說。供應鏈是其中更大的挑戰,“無論國產還是海外供應都存在不足。鎖定供應鏈,未來發展才更有確定性。”
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。