2026年下半年,算力競賽為何突然轉向超節點?

2026年7月27日 11:52
2026年下半年,算力競賽為何突然轉向超節點?

重點摘要

# 算力競賽突然轉向超節點:一場關於大模型基礎設施的軍備賽 “中國大型互聯網企業會在下半年大量部署超節點方案。”一位算力資深人士向數智前線透露了市場的最新走向。雖然超節點整機價格通常高於同等卡數的普通服務器,“但它的賬算得過來,算力密度更高、空間佔地更小。現在企業必須在有限空間承載更多算力,超節點是個‘大殺器’。”新華三人士補充道。 即便此前沒有採用超節點的DeepSeek,“最近也明確要用,正在議價。”一位雲計算大廠人士告訴數智前線,這具有風向標意義。

站內 AI 整理稿

# 算力競賽突然轉向超節點:一場關於大模型基礎設施的軍備賽

“中國大型互聯網企業會在下半年大量部署超節點方案。”一位算力資深人士向數智前線透露了市場的最新走向。雖然超節點整機價格通常高於同等卡數的普通服務器,“但它的賬算得過來,算力密度更高、空間佔地更小。現在企業必須在有限空間承載更多算力,超節點是個‘大殺器’。”新華三人士補充道。 即便此前沒有採用超節點的DeepSeek,“最近也明確要用,正在議價。”一位雲計算大廠人士告訴數智前線,這具有風向標意義。這一熱潮在2026世界人工智能大會上表現突出:華為展出了20個機櫃組成的1024卡超節點真機、中科曙光展示了沸騰著冷卻液的640卡超節點,百度天池、阿里雲靈駿真武M890、浪潮信息元腦以及沐曦曦景S600,都被放在各自展臺的突出位置。 ## 超節點是什麼?為何成為主流? 簡單來說,超節點通過高速互聯技術,把大量GPU或加速卡從“多臺服務器”深度整合成邏輯上像一臺“超級計算機”的系統,解決了傳統集群跨機器通信的帶寬和延遲瓶頸,從而大幅提升GPU或加速卡的利用率,帶來單位Token成本的下降。“超節點已成為目前AI Infra建設的一個主流趨勢。”華為資深人士對數智前線說。 一年前,超節點還是少數廠商展示系統能力的旗艦產品;一年後,它正在成為主流算力企業必須參與的軍備賽。“國產超節點從去年推出,目前已發展到可批量落地階段。”百度崑崙芯人士說,“到今年底,每家算力企業基本上都具備交付能力。”

## 誰在造超節點?三大路線浮現

超節點不是新概念了。2024年,英偉達發佈GB200 NVL72,將72顆Blackwell GPU納入一個高速互聯域,推動該架構進入業界視野,但最初需求並不算旺。到2025年,隨著大模型參數暴漲,超節點才成為熱點。國內廠商也早在2024年前後開始做技術預研,最早一批在2025年上市,華為、百度智能雲、浪潮信息、新華三、中興等各家都開始發佈。超節點賽道開始湧入多個玩家。 但各家爭奪的焦點不太一樣,目前似乎形成了三條不同路線:一派不斷擴大單個超節點的規模,一派更強調部署效率和經濟性,還有一派試圖用新的芯片和互聯架構重新定義超節點。 **「大節點派」:追求更大規模的超節點**

華為已向業界展示由20個機櫃組成的1024卡的昇騰950超節點真機,並將在今年第四季度批量交付8192卡超節點,理論上這是該超節點滿配技術上限。華為的判斷是,隨著大模型參數、上下文長度和推理併發量持續增加,單個計算域需要容納更多芯片和更大的內存空間。而其去年推出的384卡超節點已在互聯網、金融、能源、教育和醫療等行業,商用落地750多套,證明了超節點的商業規模部署能力。 中科曙光選擇了浸沒式液冷支撐更高密度部署。單機櫃640張加速卡,一臺冷卻設備帶兩個機櫃。由這一超節點構建的十萬卡算力集群曙光8000(登峰),已落地國家超算互聯網鄭州核心節點。“目前已跑滿了90%,很多需求來自模型訓練,也有AI for Science。”曙光人士告訴數智前線。 百度智能雲天池超節點則從256卡向512卡演進,後者將在年底推出。它強調從互聯協議、交換芯片到液冷系統的全棧自研。百度智能雲混合雲部總經理杜海介紹,其超節點已經交付多個萬卡集群。文心5.1重要版本的訓練在全國產集群上完成,能源電力行業支撐80多個行業場景推理,也支撐了自研電力大模型的訓練。 **「小節點派」:強調經濟性和實用性**

另一批廠商並不認同“越大越好”。阿里雲推出的靈駿真武M890,以64卡為一個Scale-up單元,再通過Scale-out網絡擴展至更大集群。與多數超節點主要面向私有化部署不同,阿里還將這種算力形態放到公共雲上,客戶不必採購設備,也可以按需調用。 浪潮信息、沐曦也選擇了類似方向。浪潮信息去年推出64卡超節點,今年再推32卡產品。32卡可以支撐萬億大模型推理。浪潮信息副總裁趙帥介紹,“我們自己內部用萬億大模型做AI Coding,效率絕對比用千億大模型好。這就是萬億參數大模型帶來的價值。所以再次推出32卡產品,讓更多企業真正用得起。”沐曦則以單櫃64卡為基礎,強調CUDA生態兼容和向萬卡集群的橫向擴展。 **「第三路徑」:新芯片與新架構的嘗試**

還有一些廠商試圖跳出英偉達GPU或華為加速卡路線,走了第三條路徑。清微智能採用可重構數據流架構,每顆芯片同時承擔計算和數據轉發,芯片之間可直連,無交換機。清微智能產品副總裁陳逸倫告訴數智前線,已推出4096卡、峰值算力為500PFLOPS的超節點。北京某訓練場已部署,內蒙、新疆、浙江的金融行業、國央企也已落地。採用同樣路線的還有7月產品剛剛上市的東方算芯。 此外,摩爾線程也計劃年底伴隨新一代GPU推出相關產品。寒武紀雖然目前沒有超節點,但業界判斷下一代芯片也將推出超節點。至此,國內主要算力芯片、服務器企業,幾乎都已進入這一賽道。 ## 為什麼是今年?三大因素推動爆發

超節點為什麼會在今年爆發?業內認為有三大原因。 **第一,模型訓練和推理需求足夠大。**訓練端,模型參數量在飆升。7月Kimi發佈參數達2.8萬億的大模型K3。“下一個春節,模型參數會變成3萬億,再下一個6萬億,在後面是10萬億。而海外中等規模模型參數量已達5萬億。”沐曦CTO楊建博士告訴數智前線。業界通常認為,1萬億參數模型訓練需要約5000張卡,3萬億參數模型大約需要1萬張卡,6萬億需要2萬張卡訓練。解決方案最好是把多個芯片連成一體化去運作。 推理端,華為人士舉例,AI Coding場景中,一個任務觸發的操作調用已是幾萬次,複雜長程任務是幾十萬甚至上百萬次。“這意味著更多併發、更長上下文,這正是超節點大內存池的核心賣點。”從訓推需求比例來看,阿里雲資深人士告訴數智前線,目前線上推理和訓練比已接近5:1~10:1,“1萬張卡裡,大約70%~90%都在做推理,只有少部分在做訓練”。 **第二,賬算得過來。**超節點的價格比同樣卡數服務器總價要貴,但客戶算的是總體效能賬。“你不能單看卡的數量,它涉及風火水電基礎設施,超節點更集約。為什麼大企業都去部署超節點,肯定是算得過來這個賬。”新華三人士告訴數智前線。浪潮信息副總裁趙帥曾舉例:“通過超節點,如果推理性能提升10倍,但耗電可能只提升2倍,算下來還有收益的。”

崑崙芯人士介紹,傳統模式下10臺機器的算力相加不等於10,“只能等於6”,超節點通過高速互聯把損耗降到最低,讓更多算力發揮效能。如用超節點做PD分離推理,系統比普通同卡數機器提升30%到50%的性能。 **第三,批量交付節點到了。**“超節點是工程化產物,它包含GPU芯片、存儲、通信、交換、散熱、供電、軟件,不是單一廠商能獨立搞定的。”崑崙芯人士說,“目前,超節點已發展到可批量落地階段了。”另一位人士補充,“無論性能做得怎麼樣,大家都可以把整機交付出來”。 ## 訓練還是推理?超節點的最佳應用場景存分歧

不過,超節點更適合訓練還是推理?各家的說法並不同。華為人士認為,訓練、推理都有價值,萬億參數大模型訓練需要巨大內存池,Agent推理需要海量上下文併發,超節點要具備大內存卡。摩爾線程認為,超節點要面向1萬億到5萬億參數大模型訓練,以及高速推理的tokens工廠場景。而沐曦人士認為,“經過嚴密論證,超節點在推理的Decode階段,也就是逐Token生成答案時,價值更為突出。”清微智能陳逸倫分析,“目前超節點在訓練側跑微調較多,拿它做推理性能更好。”

## 核心分歧:超節點該做多大? 爆火之下,超節點技術路線有諸多分歧,目前還沒有標準答案,取決於各企業的技術商業判斷。第一個分歧是規模之爭,超節點應該做多大?是64卡/128卡,還是更大規模?行業分成兩個陣營,這裡說的是超節點Scale-up的規模,就是用高帶寬、低時延互聯,把多少芯片納入一個緊耦合計算域。 “小節點派”認為:“在我個人認知裡,64卡就夠了。TP並行、EP並行的最大規模可能就是64卡,剩下的通過PP和DP並行、Scale-out去連起來。你沒必要把單個節點的Scale-up做到足夠大,因為任何通信都有延遲,TP和EP對延遲極度敏感,即便千卡互聯中間幾個微秒的延遲,GPU其實都在等。”一位人士告訴數智前線,“對時延和穩定性都要有考慮,這是一個工程上的平衡,並不是scale up越大越好。”另一位人士持相同立場,“64到128卡是最經濟的形態,再大就浪費了。”

“大節點派”則主張:進入Agent時代後,萬億參數、百萬Token上下文和海量併發推理下,64/128卡小節點統一內存池太小。64卡更像基礎機櫃單元,適合中小規模模型微調、離線推理;萬億大模型完整訓練、大規模多智能體併發,必須依靠更大規模超節點。 ## CUDA兼容之爭:自研生態還是兼容路線? 第二個核心分歧是CUDA兼容之爭。阿里平頭哥、沐曦、海光等走CUDA兼容路線,代碼遷移成本低。華為昇騰、崑崙芯等走自研生態路線。 一位大廠人士對數智前線分析,自研生態雖然遷移成本高,但可控性和長期演進空間更大。他坦誠,也許兩三年後,CUDA兼容就沒有那麼重要了。“我們迴歸技術第一性,CUDA當年的勝出,是很多人做向量編程,心智負擔很大,而CUDA方案讓人在心智上的耗費極大降低,所以在過去10多年取得成功。但到今天有了Agentic coding後,不一定是人去編程,都走向讓Agent去幹,所以CUDA就不那麼重要了。”

一位華為人士介紹,華為是國內最先支持mxfP8和fp4精度的廠商,mxfP8的可變量比fp8更好。“有人說昇騰從CANN走向了CUDA,其實並不完全正確。”他說,“華為增強了向量處理能力,而英偉達增強了矩陣處理能力,兩家都走向了‘矩陣和向量綜合型’方向。”

## 其他技術分歧與共識

還有其他的分歧,如連接中銅纜與光纖,液冷中的風冷和液冷,尤其是浸沒式液冷,這些新舊技術轉換中,因技術瓶頸、故障率與運維成本產生的矛盾和挑戰,讓業界有不同的技術商業選擇。 一個共識是軟硬架構協同。超節點演進與模型技術路線密切相關。國內模型架構如何演進?阿里人士告訴數智前線,國內模型企業Attention正在分化為兩條路線,其中千問GDN、Kimi KDA走向Linear Attention;DeepSeek走Smart Attention(MLA、DSA、CSA),智譜目前也採用DeepSeek 3.2的DSA架構。兩個陣營相對獨立,仍需觀察未來兩三年的演進,這也將影響超節點的硬件適配方向。 浪潮信息董事長彭震最近介紹,過去基礎設施主要沿摩爾定律演進,最近的新進展是軟硬件聯合創新,一端提出新算法,另一端用新介質、硬件和網絡適配,收益顯著。他看到美國企業也在開展類似探索。 ## 未來展望:真正的競爭才剛開始

在沐曦楊建博士看來,這條賽道“未來二三十年都停不下來”。今年,他已看到一些企業開始用AI參與設計,道路、房屋、機械等設計本質上都屬於知識生產,AI的影響早已超出coding,正在滲透到各行各業。一位大型企業管理者希望,到2027年底實現“白天開會寫規範,下班前交給大模型,第二天看結果”,人負責定義和發現問題,大模型負責求解。目前,AI知識創造的進程,“很多企業還沒開始,因為總經理和董事長還沒有作出對數字員工的定崗決定。”資深人士觀察。這正是AI要滲透的市場。 而算力越便宜,行業擴張就越快,“整個鏈條就再也停不下來了”。美國算力約為中國的9倍。超節點正成為這條產業鏈向下延伸的重要算力底座。隨著更多廠商具備整機交付能力,真正激烈的競爭已經開始。 “現在比拼的是能否批量交付、穩定運行,並真正降低每Token成本。”一位大廠人士說。供應鏈是其中更大的挑戰,“無論國產還是海外供應都存在不足。鎖定供應鏈,未來發展才更有確定性。”

Related

相關文章

鈦媒體模型更新

工業AI走向自主執行,工程師該往哪走?|鈦度圖聞

工業AI走向自主執行,工程師該往哪走?|鈦度圖聞鈦度圖聞2026.07.27 12:57 · 來自北京全文1802字00:00 / 05:40工業AI開始親自下場幹活了!但拍板權仍在人——工程師轉型為定場景、驗結果、守底線的把關人。如果未來的產業史要給2026年取名字,它大概率會被叫作「工業智能體元年」。

剛剛
量子位模型更新

DeepSeek被曝主動叫停了第二輪融資簽約

# DeepSeek百億融資臨門叫停,三大懸念牽動市場神經 原計劃在未來幾天內簽約的百億級融資,在最後關頭被按下暫停鍵。7月25日,據彭博社報導,中國人工智能獨角獸DeepSeek已口頭通知部分潛在投資方,原定於近期簽署的第二輪外部融資協議暫不執行。這一消息迅速引發市場廣泛關注,也為這家正處於快速擴張期的AI公司蒙上一層不確定性迷霧。 ## 百億融資估值再攀升 按照彭博此前披露的信息,DeepSeek在此輪融資中計劃募集至少100億元人民幣。若最終參與投資者數量增加,融資規模還有進一步擴大的空間。

剛剛