智東西生成式AI

原生液冷不是液冷技術的“Pro Max”,Token工廠需要一次系統重構

2026年8月3日 04:18

重點摘要

隨著AI代理與Token需求爆發,傳統冷板液冷在算力密度、空間與互連上出現系統性瓶頸。浪潮信息提出原生液冷架構,從系統層級整合計算、散熱、互連與供電,並推出GPU與CPU原生液冷整機櫃,單櫃可承載千卡算力並支撐大規模Agent運行。報導認為,在硬體趨同下,系統架構能力將決定Token產能的上限。

站內 AI 整理稿

Agent應用爆發帶動AI算力需求急遽攀升,Token消耗量正以指數級速度成長。從年初開源項目OpenClaw爆紅開始,AI任務型態已從單一模型訓練與推理,轉向大規模多模型協同與海量Agent持續運作,進入「永遠在線」的新階段。中國工程院院士、清華大學教授鄭緯民在2026世界人工智能大會上指出,單一智慧體的Token消耗量可達傳統對話應用的百倍至千倍。隨著海量Agent併發呼叫模型、讀寫記憶、編排任務與執行工具,Token消耗速度持續飆升,直接推高AI基礎設施的規模天花板,千卡集群已不敷使用,萬卡、十萬卡集群正成為前沿大模型訓練的標準配置。 然而數據中心的電力與空間終究有限,想要滿足無上限的Token需求,關鍵在於單位空間內塞進更多算力,將算力密度逼到極致。算力密度提升帶動單機櫃功耗從數十千瓦躍升至數百千瓦,並進一步朝MW級邁進。當單櫃功率到達這個量級,傳統冷板液冷方案開始浮現散熱跟不上、空間不夠用、互連被干擾三大瓶頸,三條限制同時在有限的空間內收窄。Token工廠想要持續擴產,計算、散熱、互連、供電不能再各自為政,必須從系統底層尋找新的解方。原生液冷這個從系統層面將計算、散熱、互連、供電耦合的方案,因而開始進入產業視野。 Token需求井噴將單機櫃功率推高,也把部署空間壓縮到極限,傳統液冷的短板在此情境下被急劇放大。第一個困境是算力密度受限於全系統熱管理。高算力密度代表單位空間內整合了更多晶片乃至HBM、記憶體、網路卡、光模組等全系統元件,也代表需要導出更多熱量。在高密度部署下,傳統冷板液冷「逐個加板」的方式難以追上全系統發熱的成長速度,一旦散熱能力跟不上,晶片觸發溫度牆而降頻,Token產出便從峰值持續衰減。 第二個困境是散熱結構持續擠佔計算空間。當前冷板液冷佔據液冷數據中心市場93.5%的份額,但多數方案的底層邏輯仍是將風扇、冷板、軟管、分液器層層疊加,散熱結構不斷擠佔本屬於計算單元的空間,進一步壓縮單櫃GPU裝載上限。當機櫃功率邁向MW級,這種空間矛盾被急劇放大,散熱越複雜、擠佔空間越多、能放下的計算單元越少,單櫃Token產能上限就此被鎖死。第三個困境則是散熱與互連的衝突在MW級被放大。Scale-up計算域擴大,需要更多計算節點與交換節點組成高頻寬、低延遲的統一系統,但在傳統架構中,背板、線纜、風道、冷板、液路分別規劃,互連路徑被拉長、接口數量增加、通信延遲上升。當數十甚至上百顆GPU需要頻繁同步數據時,微小的延遲都會被成倍放大,多卡並行推理的整體效率被系統性壓低。 這三重困境指向同一個結論:Token工廠的問題已經超出「散熱」本身,而是計算、互連、供電、散熱在有限空間內互相牽制的系統性困局。要同時擺脫這三重困境,必須從系統設計源頭重新思考,把計算、散熱、互連、供電作為統一整體來規劃。傳統液冷是「先定計算、再配散熱」,在計算系統定型後再找空間塞液冷設備。原生液冷不是冷板液冷的「Pro Max」版,本質區別體現在三個維度:時間維度上,熱設計從後置變為前置;空間維度上,散熱從分散覆蓋走向全域管理;邏輯維度上,優化對象從單一散熱部件上升為整個計算系統,計算、散熱、供電、互連不再各自為政。 這種系統重構沿著算力密度、空間密度與互連密度三個方向展開。算力密度方面,原生液冷採用散熱架構與計算架構協同的全系統熱設計,透過一體化冷板與全域液冷重構,將GPU、CPU、記憶體、網路卡、光模組、SSD全部納入統一熱管理,整機櫃算力密度可提升至傳統方案的10倍以上。散熱能力提升後,晶片在持續高負載下不掉頻,Token產出穩定在峰值。空間密度方面,原生液冷透過系統結構重構釋放計算部署空間,採用一體化冷板與極簡工程設計,實現零軟管、零線纜、零風扇,裝配接口減少80%、流阻降低60%,釋放50%設備空間用於晶片、記憶體和互連等核心單元,單櫃Token產能上限被徹底打開。互連密度方面,原生液冷採用無中背板正交直連架構,將計算節點與交換節點解耦,透過前後向最短路徑構建高密度、低延遲的直連網路矩陣。基於單GPU與Switch 4.8TB/s高速直連設計,64卡全互連架構可提供300TB/s互連頻寬,支援224G高速數據傳輸,更短的互連路徑意味著更低的通信延遲與更高的多卡協同效率。 架構邏輯成立之後,下一個問題是這些能力如何落地為產品。Agent從接收指令到完成任務,要經歷工具呼叫、記憶讀寫、任務編排、並行調度等多個步驟,而這些編排調度類任務主要運行在CPU上。Agent的完整工作流是「兩條腿走路」:GPU負責高速生成Token,CPU負責高效調度Agent,兩類算力缺一不可。浪潮信息基於原生液冷架構,針對這兩類需求分別推出高密整機櫃產品。GPU原生液冷整機櫃伺服器在48U空間內承載千卡算力,單櫃算力密度達傳統方案10倍以上,創新採用一體式SDAC冷板,將GPU、CPU、記憶體、網路卡、光模組等熱源在整塊冷板上雙面高密平面化部署,散熱效率翻倍;互連方面首創無中背板MDP矩陣式直連架構,1024顆GPU與Switch之間透過高速直連形成高密全互連矩陣,支援千卡、萬卡超大規模無損擴展。單櫃功率覆蓋330kW至1MW,大模型吞吐達到146萬tokens/s,一個MW級機櫃就能撐起一條高產的Token產線。 浪潮信息同步推出CPU原生液冷整機櫃伺服器,基於液冷OCM架構,單櫃整合384顆CPU,支援4萬以上Agent高併發運行,確保高負載下不掉頻、不降速,讓Agent的調度響應始終保持在低延遲狀態。GPU整機櫃負責高速生產Token,CPU整機櫃負責高效調度Agent,兩類算力底座在統一的原生液冷架構下協同工作,從Token生成到Agent執行,全鏈路不再有散熱瓶頸拖累,也不再出現某一端掉速導致整體排隊的情況。 當前AI基礎設施賽道硬體層面的差距正在收窄,各家廠商能採購到的核心器件幾乎一樣,晶片本身的性能天花板也越來越透明。當GPU、HBM、網路晶片逐漸趨同,電力和空間成為AI基礎設施的硬約束時,真正的分水嶺在於誰能把相同的組件組織成更高效率的算力Token產線。同樣的千卡規模算力,放進不同的系統裡,最終Token產出可能差距30%甚至更多,差距不在晶片本身,而在晶片與晶片之間如何通信、熱量如何導出、供電如何分配、空間如何利用。這些系統層面的設計選擇,最終決定了每一顆晶片的性能有多少能被真正釋放出來,這就是系統架構能力的價值所在,也是原生液冷做為系統級創新的物理層體現所回應的核心命題。

Related

相關文章

量子位生成式AI

阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定 量子位的朋友們 2026-08-03 12:58:17 來源:量子位 8月3日,阿里巴巴正式發佈新一代基座大模型Qwen3.8,總參數量2.4萬億,在編程(Coding)和專業辦公(Cowork)方面能力大幅提升。今日放榜的權威三方榜單Arena中,阿里Qwen模型僅次於Anthropic的Claude系列,整體性能處於全球大模型第一梯隊。目前,Qwen3.8的API已上線千問AI平臺,並接入阿里今日同步推出的Agent產品“千問辦公”。Qwen3.8-Max預計下週開源,同時還將開源 Qwen3.8-27B。 今日起,全球開發者都可通過千問AI平臺獲得Qwen3.8的API服務,國內每百萬Tokens輸入12元、輸出36元,隱式緩存命中僅1.5元,而輸入與輸出的國際價格僅為Opus5的40%與24%,實現相近智能更高性價比。 圖說:權威三方榜單Arena全球排行榜更新 此次發佈的是千問大模型系列中尺寸最大、性能最強的旗艦模型Qwen3.8-Max,它支持視覺理解,上下文長度達1M Tokens。在模型架構上,Qwen3.8通過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.4T,激活95B,獲得了更高的推理效率、更快的推理速度,整體性能也迎來新突破:在科研復現評測PaperBench等編程智能體評測中,Qwen3.8-Max較上代模型大幅提升28.2分,以93.0分錄得評測新高;在WideSearch、Agent’s Last Exam等通用智能體評測中,

剛剛
量子位生成式AI

賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發!

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發! Jay 2026-08-03 12:29:44 來源:量子位 終究還是喜提了「美國豆包」 Jay 發自 凹非寺 量子位 | 公眾號 QbitAI 啥,谷歌真比OpenAI還早一年搞出了ChatGPT? 不是谷歌事後找補了,這次是OpenAI自己人,Codex負責人Tibo剛佐證的消息: 那就是早一年版的ChatGPT。最初叫LMChat,後來又換了另一個代號。 谷歌太緊張了,不敢發佈它,而DeepMind則被禁止推出可能衝擊谷歌業務的產品。 但Tibo為啥對這段陳年舊事如此瞭如指掌? 答案是:他當時就在那支谷歌團隊裡。 我當時就是那個團隊的一員。 是的,如今為OpenAI打造「無限Token」的Tibo,正是當年穀歌那個項目的親歷者。 網友都震驚了,Tibo還有這麼一段經歷: 不er,我還以為你只是個Codex的重置按鈕(bushi)。 Jeff Dean:我不甘心啊!! 事情是這樣的,一名Midjourney工程師,最近在X上翻出了前谷歌大腦負責人Jeff Dean的一段舊採訪: 我有時會想Jeff Dean的那次採訪,他說他們在ChatGPT之前就有一個內部的Chatbot,但覺得用它還不如直接用谷歌搜索。 沒想到Tibo親自下場回覆,和Jeff Dean來了波隔空對話: Jeff說的那個項目確實存在,最初叫LMChat,幾乎就是一個早了一年的ChatGPT。 至於為啥沒發出來,Tibo無奈地表示,DeepMind沒這權限啊,LLM會衝擊谷歌搜索,老闆們緊張壞了,不給拍板。

剛剛

生成模型也能端到端訓練了?核心竟是一個for循環

2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。

剛剛

數百萬本書,被Claude “閱後即焚”

Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。

剛剛

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent

王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

剛剛

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。

剛剛