硅谷扔出“巨內核”,中國團隊祭出“超級算子”,萬億參數模型效率戰打響!

2026年9月30日 10:00
站內 AI 整理稿

作者 | 李水青 編輯 | 漠影 2.8萬億參數的大模型,究竟要怎麼跑快?近日,海內外團隊盯上了全球最大參數量的開源模型——Kimi K3。K3憑藉2.8萬億總參數、104B激活參數,刷新了開源模型的性能上限。但普通的AI服務器難以承載這麼大參數量的模型,Kimi官方推薦64卡甚至更大規模的AI服務器才能裝得下。有業內人士表示,一般未經優化的超節點跑Kimi K3,初始性能可能僅在10 tokens/s左右。面對如何讓2.8萬億參數的Kimi K3跑得更快這一難題,國內外團隊幾乎同時交出了答卷。

9月21日,浪潮信息在AICC 2026發佈元腦SD200 Ultra超節點AI服務器,通過緊耦合128芯本土AI芯片,單機承載2.8萬億參數Kimi K3,Token生成時延首破5.85毫秒。9月23日,海外TPU推理優化團隊Inferact開源tpu-megakernels,用16顆谷歌TPU v7芯片把整個K3裝進一個kernel(內核),配合DSpark投機解碼,低併發Decode(解碼)吞吐達到709 tokens/s。一個用本土芯片做商業化超節點,一個用Google TPU做開源推理項目,指向了同一個技術思路:打破算子邊界,把大模型推理的計算過程融合到極致。

大模型推理的競爭,正從模型算法層,深入到系統軟件、芯片互聯和內存管理層。一、萬億MoE太難跑,海內外團隊同時盯上算子融合 萬億參數大模型推理為什麼慢?很多人以為是算力不夠,而實際瓶頸更在於數據搬運和內存帶寬。據知名半導體行研機構SemiAnalysis分析,K3一次前向計算的HBM帶寬需求約1.5TB,896個專家需要分佈到多張芯片上,每次前向還會觸發超過120次All-to-All通信。即便芯片具備強大算力,數據傳輸跟不上節奏,大量計算能力也會被白白閒置。對於Decode(解碼)階段而言,問題尤其明顯。每生成一個Token,模型都需要持續讀取大量權重。

vLLM、TensorRT-LLM等傳統推理框架往往需要啟動大量Kernel,每個Kernel完成自己的加載、計算和寫回,然後再啟動下一個Kernel。於是,計算之間出現了大量細小的“空泡”。這些碎片化空泡累積起來,就是實際速度與理論峰值之間的鴻溝。既然kernel邊界是浪費來源,那是否可以嘗試消滅邊界?Inferact的思路是整個模型就是“一個kernel”。其megakernel方案使用Google Pallas,把K3的92個MoE層放進一個Pallas調用,在一個Kernel內部完成整個解碼過程。當前層計算時,下一層權重就可以通過異步DMA提前從HBM搬運到片上VMEM。

這套打法成立的關鍵是TPU v7的架構特性。每個TensorCore自帶64 MiB VMEM,數據進入VMEM後,其生命週期可以由程序顯式控制。於是,Kernel作者可以主動安排哪些權重提前搬運,哪些激活繼續駐留,哪些數據在使用結束後立即釋放。換句話說,Inferact做的是把整個模型看成一個連續的數據流。浪潮信息沒有把整個模型徹底壓成一個Kernel。團隊把眾多基礎算子融合成超級算子,用系統級緊耦合架構榨取整體效率。針對K3推理特點,他們把KDA、Gated MLA、MoE中眾多基礎算子融合為計算與通信協同執行的大算子,算子數量降低10倍,模型推理性能提升3倍以上。

具體來看,第一步是把小算子“焊成”大算子,減少中間停靠。按片上存儲容量劃分數據塊,讓前一步的結果直接留在寄存器或片上緩存中供後一步使用,減少kernel launch次數,也避免中間結果反覆寫入和讀取HBM。第二步,把通信和計算融合,讓數據傳輸和計算同步進行。超級算子按照Tile(數據塊)組織流水線,通過異步搬運和多緩衝機制,讓下一塊數據預取、當前數據計算和上一塊結果寫回同時進行。跨芯片通信也按照Tile推進,把通信延遲儘可能藏到計算過程裡。可以看到,前者把整個Decode過程放進一個megakernel,後者把大量細粒度算子融合成超級算子。

它們共同指向的,是傳統“一個Op(算子)對應一個Kernel”的計算方式正在鬆動。二、用K3優化K3:讓AI參與超級算子優化 超級算子能夠減少推理過程中的數據搬運與等待,但其設計和優化本身也是一項複雜的工程。數據如何複用、計算與通信如何銜接、不同階段如何形成流水,都需要結合具體模型和硬件條件進行設計與驗證。這些工作需要大量人工投入。能否讓AI參與其中,提高超級算子的生成與優化效率?為此,浪潮信息在元腦SD200 Ultra適配Kimi K3的過程中引入“超級算子智能體”,讓Kimi K3參與自身的推理優化。

針對K3的推理特點,智能體生成通算融合、Tile級流水的超級算子,推動計算、通信與數據搬運協同執行。浪潮信息首席AI戰略官劉軍在採訪中打了個比方:過去大模型推理由數百個算子串聯執行,如同綠皮火車途經數百個小站,反覆啟停裝卸數據,整體效率低下;而超級算子就像一站直達的高鐵,省去中間停靠開銷。劉軍談道,以往行業清楚這套模式的短板,但人工算子優化調度的工作量巨大。如今Agent帶來解法,浪潮信息採用“用K3優化K3”的思路,依託超節點系統架構,由AI智能體自動生成超級算子,再經由模型校驗迭代,性能較此前再度提升50%,形成循環加速。可以看到,模型已經不只是被優化的對象,也開始成為優化基礎設施的工具。

這可能會成為下一代推理優化的重要範式。三、芯片一張牌,系統一張牌:超節點打的是系統戰 Agent時代,Token消耗增長數百萬倍。據Gartner 2026年3月報告,一個Agent工作流每任務消耗的Token量是標準聊天機器人的5到30倍;高盛預測,到2030年全球Token消耗量將較2026年增長24倍,達到每月約120000萬億Token。需求側爆發,算力供給如何接住?這裡可以看到兩個典型困境。第一個是Kimi K3代表的“向上”。模型越來越大,推理能力越來越強,長上下文、複雜推理、多Agent協同越來越多,單機越來越難承載,算力系統需要不斷突破模型能力上限。

第二個是DeepSeek代表的“向廣”。當越來越多用戶開始調用低成本模型,Token需求會迅速擴張。模型本身可能已經足夠便宜,但如果算力供給跟不上,低價Token就很難持續。浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),兩條線齊頭並進。向上,SD200 Ultra用5.85ms/token、單用戶170 tokens/s,讓前沿模型跑得起、跑得快。向廣,HC2000多元算力機組用DirectCom 2.0極速架構,Prefill、Decode、FFN按負載匹配多元芯片,同等投資Token產能提升10倍。

中國玩家的護城河在哪裡?單看芯片,其與NVIDIA仍有差距,單卡算力、生態、工具鏈都有明顯短板。但到了超節點層面,靠系統級創新可以追平甚至超越單卡更強但系統鬆散的方案。以浪潮信息SD200 Ultra為例,其用3D Hyper Mesh架構緊耦合128芯本土AI芯片,提供8TB統一編址顯存和64TB內存,通信時延低至0.69微秒。通過對稱內存技術,首次在基於本土AI芯片的超節點上實現GPU顯存直連,AllReduce通信時間降低3.5倍。劉軍談道,超節點最基本的特徵是顯存要統一尋址,這一點做到了,才能把這麼大的模型放進去,否則就只能叫節點集群,還是需要把模型拆分成若干段。

總的來說,芯片是一張牌,系統工程則是另一張牌。當芯片之間能夠形成更緊密的連接,內存能夠形成統一空間,通信可以藏進計算過程,算子又可以由AI持續優化,單芯片性能之外的系統紅利就開始釋放。對於本土算力而言,這條路徑尤其重要。結語:萬億模型推理需求爆發,效率革命才剛剛開始 AI算力競爭,正從造出更快的芯片變為把現有芯片組織到極致。Inferact用16顆TPU證明一個kernel可以裝下2.8萬億參數;浪潮信息用128顆本土芯片證明系統級緊耦合加超級算子,可以讓本土算力跑進第一梯隊。兩條路線,一個方向。大模型推理的效率革命,才剛剛開始。

對中國AI產業,這個方向的特殊意義在於,在芯片工藝受限的約束下,系統級創新是確定性最高的追趕路徑。浪潮信息邁出的這一步,值得被更多人看見。

Related

相關文章

量子位生成式AI

Anthropic,你是來給智譜打廣告的吧!

。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。

剛剛

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物

它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

剛剛

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈

據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

剛剛
鈦媒體生成式AI

獨家|元寶將殺入個人智能體大戰

字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

剛剛