單機跑Kimi K3首破5.85毫秒,同等投資Token產能提升10倍!浪潮信息破局Agent算力難題

2026年9月22日 18:50
單機跑Kimi K3首破5.85毫秒,同等投資Token產能提升10倍!浪潮信息破局Agent算力難題
站內 AI 整理稿

(公眾號:zhidxcom) 作者 | 王涵 編輯 | 漠影 2026年,Agent的火爆程度空前。9月21日,在AICC 2026大會上,IDC發佈了一組數字:2026年全球活躍Agent約7940萬個,到2030年將達22.16億個。而同期Token消耗量的增長更為驚人:從2026年的0.026Peta(千萬億),增長到2030年的152667Peta。Agent數量增長約28倍,Token消耗卻增長數百萬倍。需求側增長如此之快,算力供給能接住嗎?今年有兩個案例十分典型: 一是Kimi K3。這個總參數量2.8萬億的模型,權重文件達到1.

56TB,普通AI服務器的GPU顯存連權重都裝不下,官方推薦至少64卡甚至更大規模才能運行。它指向的是“向上”的困境:當Agent需要更強推理、更長上下文和更多智能體協同,能力上限越高,部署門檻越從單機走向集群。二是DeepSeek。2026年上半年,它曾將V4-Pro的API價格下調75%,並稱調整長期有效;但8月又預告整體提價,理由直指“算力不足”。它指向的是“向廣”的困境:當Agent大規模調用便宜模型,性價比算力的需求被迅速放大,容量不夠,低價供給就難以持續。這兩個問題怎麼破?

在AICC 2026大會上,浪潮信息給出了自己的回答:向上,Capability AI Compute;向廣,Capacity AI Compute。會上,浪潮信息正式發佈元腦SD200 Ultra超節點AI服務器和元腦HC2000多元算力機組。“向上向廣”兩個方向齊頭並進,通過系統協同,浪潮信息從提供算力走向生產智能。一、向上,超節點突破智能上限 要理解向上的瓶頸從何而來,我們要先看清AI的需求端發生了什麼變化。過去,人們對AI的需求是回答問題,算力調用是單次且臨時的。而在Agent時代,一次用戶意圖背後,可能是幾十次、幾百次甚至更多次推理,是多個Agent連續幾小時甚至幾天的協同工作。

應用形態的變化,直接提高了對算力系統的要求。與此同時,前沿模型的Scaling up也在這一時期進入加速期。以Kimi K3為例,其參數量已經達到2.8萬億,權重文件約1.56TB,普通服務器顯存連權重都裝不下,更不用說百萬Token上下文。官方推薦擴展到64卡甚至更大規模,才能讓模型真正運行。更不用說未來可能會擴展到十萬億參數量級的更加前沿的模型。現如今,芯片之間需要高效通信,內存需要統一尋址,數據搬運需要儘可能減少。簡單地把更多服務器堆在一起,行不通了。超節點的意義,就在於突破傳統單機的計算邊界,把更多芯片和內存納入一個高效協同的計算域,為前沿智能提供更大的“有效計算空間”。

浪潮信息發佈的元腦SD200 Ultra超節點AI服務器,正是圍繞這一目標設計。元腦SD200 Ultra以開放系統設計緊耦合128芯本土AI芯片,實現統一內存尋址超低延遲通信,並以對稱直連、算子優化等創新技術減少模型運行中的數據搬移與等待。基於這套系統,SD200 Ultra可以單機運行2.8萬億參數的Kimi K3,Token生成時延首次突破5.85毫秒。同時隨著模型參數規模不斷提升,還支持10萬億參數規模的前沿模型,為模型規模和上下文長度的持續擴展提供支撐。

從技術實現看,SD200 Ultra基於128芯本土AI芯片,採用3D HyperMesh架構,提供8TB帶寬和64TB內存,讓前沿模型能夠充分利用多顆芯片的計算與存儲資源。通信方面,原生內存語義通信把跨芯片通信時延降低到0.69微秒;在推理優化上,浪潮信息構建超級算子庫體系,將KDA、Gated MLA、MoE中的眾多基礎算子融合為計算+通信的大算子,算子數量降低為原先的1/11,大幅減少了Kernel Launch次數,HBM訪問開銷,並隱藏了通信延遲,提升GPU整體執行效率。今天,AI已經能夠解決困擾學術界幾十年的NS方程。

能力型智算要做的,就是讓這些前沿能力不只是實驗室裡的演示,而是可落地、可複製的生產力。二、向廣,讓智能供給“供得上、供得便宜” 如果說Capability解決的是“智能可以有多強”,那麼Capacity解決的是“我們究竟能夠擁有多少智能”。隨著Agent數量和使用深度增加,Token需求還會繼續快速增長。提高單位計算資源的Token產出,成為規模化供給的關鍵。然而,提高Token產出並不容易。推理不是一種單一計算模式。Prefill和Decode的計算特徵不同,Attention和MoE對計算與訪存的要求不同。多模態、MTP等模型架構的發展,還會帶來更多類型的計算負載。

簡單堆更多服務器,不僅不能帶來線性能力增長,還可能因為資源浪費、失衡和任務排隊,使部分算力長期閒置,另一部分資源持續緊張。這意味著,容量型智算需要換一種思路:讓不同的算力承擔最適合自己的負載,再通過統一的軟件棧把它們組織起來。浪潮信息的答案,是元腦HC2000多元算力機組。它面向持續、大規模推理需求,基於DirectCom 2.0極速架構,以原生液冷高密整機櫃為載體,按負載組織計算資源,實現多元算力協同。

其核心軟件棧MCIS建立了一套面向多元算力的協同機制:持續測量不同算力資源的能力與負載,根據任務需求動態分配算力,並在運行過程中實時調整資源配置,讓不同類型、不同規模的算力承擔更適合的推理任務。在硬件層面,HC2000採用全液冷設計和高通流供電,單櫃供電能力達到300千瓦以上,最大承載256張AI卡,算力密度實現4倍躍升。更重要的是其算力與計算特徵的精準匹配。通過不同組合,多元芯片各司其職,再通過軟件棧組織起來,共同完成推理協同,提升整個算力系統的Token產出效率。

在國產算力基礎上,通過MCIS和某模型適配,在典型Agent任務場景中,同等SLO約束下,相比單一算力構建的推理系統,實現了同等投資10倍Token產能提升。浪潮信息首席AI戰略官劉軍曾說:“智能的價值不僅取決於最高點有多高,更取決於有多少人能夠獲得它。” 向廣的邏輯,是要將先進推理能力通過效率提升和成本下降,快速走向更廣泛的用戶,讓智能從稀缺資源,逐步成為整個社會都能獲得的基礎能力。三、從Capability到Capacity,為什麼需要系統協同?SD200 Ultra和HC2000,一個向上,一個向廣。

看似在做不同的事情,但它們底層是同一個判斷:當智能開始被“生產”,算力產業的競爭就不再是單點競爭,而是系統競爭。劉軍將這種思路概括為“貫穿式創新”。第一個層面,是從芯片、服務器系統到模型的貫穿。過去做創新,是產業鏈每一層做好自己的事——芯片、系統、框架、算法、算子,然後縱向對齊;但在Agent AI時代,面向特定模型需要做定製化或專用化優化。第二個層面,是從單機到系統的貫穿。Capacity需要從前到後的創新,把鏈條上每一環節拿出來看,根據不同計算負載的特徵匹配最適合的計算資源。

Prefill可以用大算力芯片搭配供應和成本更優的LPDDR顆粒;對於Decode階段,可以選擇具有大容量HBM,兼顧顯存容量和帶寬的AI芯片。在此基礎上,在FFN計算環節,可以選擇3D DRAM堆疊芯片,進一步縮短數據搬運路徑。放棄用同一種通用巨無霸芯片幹所有事的策略,轉而構建多元芯片、多元算力系統。第三個層面,是從技術到生態的貫穿。以前理解“多元算力”,就是服務器廠支持不同家的AI芯片;但今天出現了新的協同方式:在同一個業務裡面有多元芯片,Prefill用A家芯片,Decode用B家芯片,構成一個算力系統。產業協作從“你贏我輸”的零和博弈,轉向開放共贏。

從更長週期看,Capability和Capacity並不是兩條平行線,而是一個循環。每一次新的智能能力出現時,往往首先是昂貴而稀缺的。隨著算法進步、系統優化和工程成熟,這些能力會逐漸以更低成本進入更多模型、應用和用戶。Capability負責創造新的可能,Capacity負責讓新的可能被更多人獲得。同時,更大規模的智能普及,又會帶來新的應用、新的數據、新的需求,推動下一輪Capability突破。系統協同,正是讓這個循環持續運轉的底層機制。

結尾:Agent時代,計算產業從提供算力走向生產智能 進入Agent時代,Token工廠不能只問擁有多少GPU、CPU,還應該問:這些算力能夠支撐多強的智能?能夠以多低的成本生產多少智能?浪潮信息用SD200 Ultra向上突破智能上限,用HC2000向廣推動智能規模化供給,一個負責讓AI更強大,一個負責讓AI更普及。連接兩者的,是系統級的協同創新與開放生態。今天的Capability,正是明天Capacity需要規模化供給的能力。Agent時代,計算產業的使命,也因此變得比以往任何時候都更寬廣。

Related

相關文章

量子位模型更新

滴滴自動駕駛連獲全國工商聯及北京市榮譽榜單認可

滴滴自動駕駛首次入選2026年民營企業發展新質生產力案例,並登上北京民營企業未來產業先鋒榜。滴滴在民營企業研發投入榜單中名列第25位,北京民營企業百強第7位。滴滴自動駕駛已累計安全運行超過2200天,並與廣汽埃安合作推出新一代Robotaxi車型,開啟無人載客服務。

剛剛

世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管

報告指出,雖然人工智能正在以前所未有的速度重塑健康研究、加速科學發現並改善醫療成果,但在缺乏強有力的倫理防線與監管 oversight 的情況下,AI 醫療研究也可能引入新的風險,從而危及人權、社會公平以及公眾信任。在現有的倫理審查機制方面,世衛組織警告稱,傳統的審查體系往往難以應對人工智能帶來的新型風險,包括算法透明度、偏見、公平性、問責制、隱私保護,以及快速部署 AI 工具可能引發的潛在危害。

1 小時前3500
雷峰網模型更新

蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你;高德地圖成「職場版大眾點評」?回應來了;Muse大火,扎克伯格身價暴漲1700億

要聞提示1.蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你2.知情人士:DeepSeek將向聯合國安理會介紹AI風險,月之暗面等中國企業也受邀參會3.高德地圖成“職場版大眾點評”?回應來了4.字節通報二季度違規案例:114名員工被辭退,其中8人被移交司法機關處理5.

3 小時前