原生液冷不是液冷技術的“Pro Max”,Token工廠需要一次系統重構
重點摘要
隨著AI代理與Token需求爆發,傳統冷板液冷在算力密度、空間與互連上出現系統性瓶頸。浪潮信息提出原生液冷架構,從系統層級整合計算、散熱、互連與供電,並推出GPU與CPU原生液冷整機櫃,單櫃可承載千卡算力並支撐大規模Agent運行。報導認為,在硬體趨同下,系統架構能力將決定Token產能的上限。
Agent應用爆發帶動AI算力需求急遽攀升,Token消耗量正以指數級速度成長。從年初開源項目OpenClaw爆紅開始,AI任務型態已從單一模型訓練與推理,轉向大規模多模型協同與海量Agent持續運作,進入「永遠在線」的新階段。中國工程院院士、清華大學教授鄭緯民在2026世界人工智能大會上指出,單一智慧體的Token消耗量可達傳統對話應用的百倍至千倍。隨著海量Agent併發呼叫模型、讀寫記憶、編排任務與執行工具,Token消耗速度持續飆升,直接推高AI基礎設施的規模天花板,千卡集群已不敷使用,萬卡、十萬卡集群正成為前沿大模型訓練的標準配置。
然而數據中心的電力與空間終究有限,想要滿足無上限的Token需求,關鍵在於單位空間內塞進更多算力,將算力密度逼到極致。算力密度提升帶動單機櫃功耗從數十千瓦躍升至數百千瓦,並進一步朝MW級邁進。當單櫃功率到達這個量級,傳統冷板液冷方案開始浮現散熱跟不上、空間不夠用、互連被干擾三大瓶頸,三條限制同時在有限的空間內收窄。Token工廠想要持續擴產,計算、散熱、互連、供電不能再各自為政,必須從系統底層尋找新的解方。原生液冷這個從系統層面將計算、散熱、互連、供電耦合的方案,因而開始進入產業視野。Token需求井噴將單機櫃功率推高,也把部署空間壓縮到極限,傳統液冷的短板在此情境下被急劇放大。
第一個困境是算力密度受限於全系統熱管理。高算力密度代表單位空間內整合了更多晶片乃至HBM、記憶體、網路卡、光模組等全系統元件,也代表需要導出更多熱量。在高密度部署下,傳統冷板液冷「逐個加板」的方式難以追上全系統發熱的成長速度,一旦散熱能力跟不上,晶片觸發溫度牆而降頻,Token產出便從峰值持續衰減。第二個困境是散熱結構持續擠佔計算空間。當前冷板液冷佔據液冷數據中心市場93.5%的份額,但多數方案的底層邏輯仍是將風扇、冷板、軟管、分液器層層疊加,散熱結構不斷擠佔本屬於計算單元的空間,進一步壓縮單櫃GPU裝載上限。
當機櫃功率邁向MW級,這種空間矛盾被急劇放大,散熱越複雜、擠佔空間越多、能放下的計算單元越少,單櫃Token產能上限就此被鎖死。第三個困境則是散熱與互連的衝突在MW級被放大。Scale-up計算域擴大,需要更多計算節點與交換節點組成高頻寬、低延遲的統一系統,但在傳統架構中,背板、線纜、風道、冷板、液路分別規劃,互連路徑被拉長、接口數量增加、通信延遲上升。當數十甚至上百顆GPU需要頻繁同步數據時,微小的延遲都會被成倍放大,多卡並行推理的整體效率被系統性壓低。這三重困境指向同一個結論:Token工廠的問題已經超出「散熱」本身,而是計算、互連、供電、散熱在有限空間內互相牽制的系統性困局。
要同時擺脫這三重困境,必須從系統設計源頭重新思考,把計算、散熱、互連、供電作為統一整體來規劃。傳統液冷是「先定計算、再配散熱」,在計算系統定型後再找空間塞液冷設備。原生液冷不是冷板液冷的「Pro Max」版,本質區別體現在三個維度:時間維度上,熱設計從後置變為前置;空間維度上,散熱從分散覆蓋走向全域管理;邏輯維度上,優化對象從單一散熱部件上升為整個計算系統,計算、散熱、供電、互連不再各自為政。這種系統重構沿著算力密度、空間密度與互連密度三個方向展開。
算力密度方面,原生液冷採用散熱架構與計算架構協同的全系統熱設計,透過一體化冷板與全域液冷重構,將GPU、CPU、記憶體、網路卡、光模組、SSD全部納入統一熱管理,整機櫃算力密度可提升至傳統方案的10倍以上。散熱能力提升後,晶片在持續高負載下不掉頻,Token產出穩定在峰值。空間密度方面,原生液冷透過系統結構重構釋放計算部署空間,採用一體化冷板與極簡工程設計,實現零軟管、零線纜、零風扇,裝配接口減少80%、流阻降低60%,釋放50%設備空間用於晶片、記憶體和互連等核心單元,單櫃Token產能上限被徹底打開。
互連密度方面,原生液冷採用無中背板正交直連架構,將計算節點與交換節點解耦,透過前後向最短路徑構建高密度、低延遲的直連網路矩陣。基於單GPU與Switch 4.8TB/s高速直連設計,64卡全互連架構可提供300TB/s互連頻寬,支援224G高速數據傳輸,更短的互連路徑意味著更低的通信延遲與更高的多卡協同效率。架構邏輯成立之後,下一個問題是這些能力如何落地為產品。Agent從接收指令到完成任務,要經歷工具呼叫、記憶讀寫、任務編排、並行調度等多個步驟,而這些編排調度類任務主要運行在CPU上。
Agent的完整工作流是「兩條腿走路」:GPU負責高速生成Token,CPU負責高效調度Agent,兩類算力缺一不可。浪潮信息基於原生液冷架構,針對這兩類需求分別推出高密整機櫃產品。GPU原生液冷整機櫃伺服器在48U空間內承載千卡算力,單櫃算力密度達傳統方案10倍以上,創新採用一體式SDAC冷板,將GPU、CPU、記憶體、網路卡、光模組等熱源在整塊冷板上雙面高密平面化部署,散熱效率翻倍;互連方面首創無中背板MDP矩陣式直連架構,1024顆GPU與Switch之間透過高速直連形成高密全互連矩陣,支援千卡、萬卡超大規模無損擴展。
單櫃功率覆蓋330kW至1MW,大模型吞吐達到146萬tokens/s,一個MW級機櫃就能撐起一條高產的Token產線。浪潮信息同步推出CPU原生液冷整機櫃伺服器,基於液冷OCM架構,單櫃整合384顆CPU,支援4萬以上Agent高併發運行,確保高負載下不掉頻、不降速,讓Agent的調度響應始終保持在低延遲狀態。GPU整機櫃負責高速生產Token,CPU整機櫃負責高效調度Agent,兩類算力底座在統一的原生液冷架構下協同工作,從Token生成到Agent執行,全鏈路不再有散熱瓶頸拖累,也不再出現某一端掉速導致整體排隊的情況。
當前AI基礎設施賽道硬體層面的差距正在收窄,各家廠商能採購到的核心器件幾乎一樣,晶片本身的性能天花板也越來越透明。當GPU、HBM、網路晶片逐漸趨同,電力和空間成為AI基礎設施的硬約束時,真正的分水嶺在於誰能把相同的組件組織成更高效率的算力Token產線。同樣的千卡規模算力,放進不同的系統裡,最終Token產出可能差距30%甚至更多,差距不在晶片本身,而在晶片與晶片之間如何通信、熱量如何導出、供電如何分配、空間如何利用。這些系統層面的設計選擇,最終決定了每一顆晶片的性能有多少能被真正釋放出來,這就是系統架構能力的價值所在,也是原生液冷做為系統級創新的物理層體現所回應的核心命題。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。