PCIe顯卡被低估了!內核補齊+通信重構,DeepSeek推理吞吐翻近7倍

2026年9月24日 22:21
PCIe顯卡被低估了!內核補齊+通信重構,DeepSeek推理吞吐翻近7倍
站內 AI 整理稿

1.5臺6000D跑贏1臺B300!允中 發自 凹非寺 | 公眾號QbitAI 隨著大模型對算力需求持續攀升,GPU卡的採購成本、供給約束持續加劇。AI推理的競爭正在悄然發生轉向:不再單純比拼“誰能夠買到性能最頂級的硬件”,而是轉向“誰可以把手中已有的算力資源用得更值”。很多GPU卡,開源框架能夠完成模型加載、權重下載、服務拉起,實現“能跑起來”,但實際壓測性能往往遠低於官方宣傳水平。模型本身沒有缺陷,硬件也可正常工作,性能損失的核心,來自模型框架與硬件之間存在的性能鴻溝。這類GPU卡沒有高速卡間互聯,同時不在主流開源框架官方驗證矩陣中。

直接使用社區默認部署方案,會出現算子自動回退至低效通用實現、集合通信沿用NVLink硬件的調優參數、顯存與並行配置沿用其他硬件默認值等一系列問題。硬件本身具備的算力潛力,被軟件層的適配短板所禁錮。是石科技(METASTONE)是一家“獨立第三方全棧算力運營商”的科技企業。不綁定任何特定大模型廠商,致力於為客戶提供涵蓋硬件、組網、調度、優化與運營的一站式全棧算力交付服務。憑藉源自國家級計算中心的豐富經驗,公司確保了算力集群高達99.95%以上的安全穩定運行(SLA)。目前,是石科技已納管超過20000P的算力資源,運營10多個智算中心,擁有2個國家級超算中心。

團隊成員曾榮獲3項戈登·貝爾獎,具備深厚的超大規模集群全棧技術服務實力等。是石科技自研Meta-Infer高效部署引擎,是面向異構加速芯片的企業級高性能大模型推理引擎,嘗試通過純軟件優化手段彌合這道硬件-框架之間的縫隙,在不改動模型結構、不修改任務語義的前提下,充分挖掘GPU卡架構硬件的推理能力,為行業提供一種可能性: 依靠軟件優化,成本更低的GPU卡,有機會在部分推理業務指標上,逼近原本需要更高端GPU才能實現的服務能力。Meta-Infer高效推理引擎的整套優化邏輯,分為兩大關鍵階段: 算模協同,釋放被硬件差異屏蔽的高性能路徑; 通算重構,打通瓶頸,充分榨乾硬件資源。

最終將沉澱為Meta-Infer高效推理引擎的四項核心能力:內核補齊、算子優化與通信重構、並行與容量調優、緩存複用。1、內核補齊 主流推理框架內置了大量高性能算子,但對於不在官方驗證清單的長尾硬件,框架不會報錯,只會靜默繞開加速路徑,降級運行低效通用邏輯。很多高性能內核並非缺失,只是元數據、頁尺寸、硬件內核適配不匹配,導致無法被觸發執行。

Meta-Infer高效推理引擎,通過內核補齊完成適配修復: 對齊硬件與框架之間的元數據定義,修正頁尺寸配置,解鎖原生高性能算子路徑; 替換不適配硬件的老舊計算內核,切換為面向目標硬件深度調優的實現; 擴大通信快路徑的生效閾值,讓更多規模的通信任務避開慢速回退邏輯。△該圖由是石科技提供 以DeepSeek-V4.1-Flash為例,在8張PCIe-Only顯卡環境的社區Day0基線版本中,輸入吞吐僅1932 tok/s。

經過算模協同階段的修復適配,補齊sparse-MLA Prefill快路徑,替換FP8稠密GEMM慢內核,擴大PCIe-IPC通信快路徑覆蓋範圍,吞吐直接提升至5850 tok/s。這一階段的提升,並不是創造全新算法,而是把硬件與框架本就具備、卻被適配問題鎖住的性能釋放出來。△該圖由是石科技提供 △該圖由是石科技提供 同樣的思路也復現在DeepSeek-V4-Flash、GLM5.3等模型上:修正注意力頭補齊的冗餘計算,對KV緩存標記邏輯做向量化加速,適配硬件特性重構算子拆分邏輯,拓展CUDA計算圖覆蓋範圍,讓更多請求批次可以進入加速圖執行。

僅僅完成算模協同,多款模型就拿到20%-33%不等的吞吐增益。完成硬件適配、解鎖加速路徑之後,性能瓶頸會進一步轉移到通信開銷、並行調度、顯存分配、重複計算等環節。PCIe-Only架構卡間通信帶寬遠低於NVLink,如果直接套用面向高速互聯硬件的默認策略,GPU會花大量時間等待通信完成,算力資源被閒置浪費。2、算子優化與通信重構 依託算子優化與通信重構,Meta-Infer高效推理引擎對注意力、投影等關鍵算子做算子融合,壓縮單步計算耗時;將計算任務和集合通信做時間重疊掩蓋,把統計類計算嵌入通信間隙並行執行;改寫集合通信邏輯適配PCIe帶寬特性,降低消息傳輸帶來的等待開銷。

3、並行與容量調優 在此基礎上開展並行與容量調優,放棄框架全局固化的並行參數,針對Prefill預填充、Decode生成不同運行階段差異化配置張量並行、上下文並行策略;結合硬件顯存特性,動態調整靜態顯存佔比、KV緩存容量參數,規避顯存溢出與算子回退;面向不同業務負載,靈活匹配流水線、張量並行的組合形態,讓高併發短請求、超長上下文請求都可以拿到最優執行配置。4、緩存複用 面向長文本、視頻生成場景,緩存複用能力提供風險感知的緩存複用機制,根據實時生成狀態動態判斷緩存複用與刷新時機,在不犧牲輸出質量的前提下削減重複計算與顯存讀寫。在DeepSeek-V4.

1-Flash的實踐中,完成算模協同之後,經過通算重構的全套調優:注意力算子融合、合理裁剪投機解碼草稿長度、計算通信重疊、區分Prefill/Decode並行策略、重新調校顯存容量參數,輸入吞吐從5850 tok/s進一步提升至13274 tok/s,整體實現6.87倍吞吐提升,並且支持1M超長上下文。這套方法論具備通用性,覆蓋文本大模型、長上下文、視頻生成多類任務: DeepSeek-V4-Flash:經過全套優化輸入吞吐從14546 tok/s提升至22584 tok/s,提升1.55倍; GLM5.3:輸入吞吐自3236.78 tok/s提升至6222.72 tok/s,提升1.

92倍;P95首Token時延從141.6秒下降至46.6秒,上下文支持上限從27萬Token拓展到105萬Token; 在相同併發點配對比較下,B300的輸入吞吐約為這臺8卡整機的4.9–5.6倍(DeepSeek-V4-Flash,B300側按SGLang cookbook推薦參數配置,C8輸入33,937 / C256 60,486 tok/s),GLM-5.3 ¹上這一比值為3.5–4.7倍(B300側C8輸入16,384 / C64 23,503 tok/s)。

MiniMax H3視頻生成模型:依託稀疏注意力、自研風險感知緩存複用、Turbo LoRA多手段組合,15秒參考圖生視頻端到端生成速度提升2.48倍,峰值顯存與原始稠密基線保持持平。△該圖由是石科技提供 單機8卡整機配置,文生視頻最高吞吐達到基線的5.33倍,參考圖生視頻達到基線的4.98倍,在不明顯損失畫質的前提下大幅縮短視頻生成耗時。

把這組整機吞吐放到頂級GPU的同一把標尺上,差距比直覺更小:在統一整機口徑下(單機8卡、5秒 / 768P / 16:9),文生視頻296條/時、參考圖生視頻131條/時,對應B300的439條/時、225條/時,分別約為其67%和58%(B300側按SGLang cookbook推薦參數配置,取16實例、每實例Inflight=1的最優檔;其中文生視頻對照的是B300的FL2VA結果)。如果進一步按整機吞吐折算,在幾乎無損的Ours Cache方案下,約2.6臺6000D可對應1臺B300的文生視頻吞吐,參考圖生視頻約為2.

9臺;在Ours Cache + LoRA方案下,這一比例進一步縮小到約1.5臺和1.7臺。硬件本身沒有變化,性能差距的縮小主要來自軟件棧、緩存策略與模型優化方式的組合。下面這段是參考圖生視頻(Ref2VA)任務的同題對照,Dense基線、Cache-DiT、Turbo LoRA與本文方案並排呈現。國產GPU卡:同一套方法論同樣成立 Meta-Infer高效推理引擎也在國產GPU上完成了驗證。國產GPU往往也不在主流框架的官方驗證矩陣內,因此需要針對具體硬件重新梳理執行路徑。

例如,注意力模塊需要顯式啟用面向該平臺優化的NSA稀疏注意力實現,避免回退到低效路徑;Shared Expert融合等默認面向NVIDIA/AMD平臺的特性則需要關閉,以繞開不適配實現。通信策略也需要根據推理階段分別配置,Prefill採用偏吞吐優化的DeepEP normal模式,Decode採用偏時延優化的low_latency模式,並將Shared Expert與Routed Expert拆分到兩條stream中並行提交,以進一步與集合通信重疊。其中,僅將Shared Expert與Routed Expert改為並行提交,就在35組同配置配對測試中帶來了11.26%的吞吐提升。

這說明對於國產算力而言,“能跑起來”同樣只是第一步。通過針對執行路徑、通信模式和並行策略進行系統適配,仍可以進一步釋放硬件的實際推理性能,使其更接近規模化生產服務所需的性能水平。長尾硬件的新思路:“能跑起來”不是終點 全部優化工作均收斂在Meta-Infer高效推理引擎內部,全程無需改動模型權重與模型結構,不改變原有業務任務語義。對於開源社區大量不在官方驗證矩陣內的長尾硬件,行業過往現狀往往是:新模型發佈,權重可以下載、服務可以拉起,做到“能跑起來”,工作就宣告結束。但這套實踐證明,“能跑”和“可用、可規模化對外提供生產服務”之間,還存在巨大的軟件優化空間。

在硬件供給存在約束、高端算力成本居高不下的大背景下,Meta-Infer高效推理引擎代表了一條新路線——不必一味追逐最頂級硬件,通過內核補齊、算子通信重構、並行容量調優、緩存複用這套軟件體系,充分挖掘現有PCIe架構硬件的潛力。這為大模型推理業務帶來一種值得關注的可能性:藉助深度軟件優化,成本更友好的PCIe GPU,有機會在部分推理業務指標上向更高端硬件的服務能力靠攏。硬件的上限由芯片決定,但硬件能實際發揮出多少能力,則由軟件決定。¹ 無損NVFP4量化版本:模型權重以NVFP4部署,保持既有模型計算定義,未引入額外精度損失。*本文系獲授權刊載,觀點僅為原作者所有。

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

鈦媒體生成式AI

梁文鋒用沙盒開啟RSI

字母AI2026.09.24 18:16 · 來自北京全文4232字00:00 / 11:21DeepSeek聯合清華大學發論文,梁文鋒署名文 | 字母AIDeepSeek聯合清華大學發表了一篇文章,署名的最後一人是梁文鋒。文章表面上是說DeepSeek訓練Agent所使用的沙盒,但是論文第6節越看越不對勁。字裡行間寫了三個英文字母:RSI。通過這個沙盒,Agent能創建自己需要的環境,這個環境會再次訓練Agent,被訓練的更強的Agent會創造更好的環境。由此形成了一個小型的RSI閉環。

剛剛

首部上星AI長劇《後西遊記》幕後:沒有攝影機,100%畫面由Seedance生成,單集成本壓到十幾萬

這部規劃60集、每集約40分鐘的劇集由芒果TV出品、伯璟文化承製,全程沒有一臺攝影機,視頻生成100%交給Seedance完成。上線僅一週,芒果TV正片播放量就衝破1.5億次。把這部劇推出來的,是兩個被傳統影視邏輯卡過的人。總導演李東珅長期拍紀錄片,執導的《河西走廊》豆瓣9.

剛剛
智東西生成式AI

MiMo-V2.6剛發,小米羅福莉扔出MiMo-V3新架構!引用DeepSeek多項成果

(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日報道,昨晚,小米MiMo大模型負責人羅福莉發文,提前披露了MiMo-V3的新架構,其核心組件HySparse2率先登場,相關技術論文同步公佈。▲羅福莉發文 簡單來說,這套新架構主要解決Agent越做越多輪之後出現的三個問題:長輸入算得太多、緩存佔得太大,以及如何從越來越長的上下文裡準確找到需要的信息。

6 分鐘前
鈦媒體生成式AI

OpenAI、Anthropic同日模型大戰,“是兄弟就砍一刀”

光錐智能2026.09.24 16:43 · 來自廣西全文3968字00:00 / 10:28刀刀見骨,AI巨頭為自己畫過的大餅“填窟窿”文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏9月23日凌晨,OpenAI和Anthropic像約好了一樣,前後腳各自放出新模型:OpenAI端出了GPT-6 Sol和GPT-6 Luna兩款模型,把旗艦GPT-6 Astra的能力蒸進更快更便宜的型號裡;Anthropic則亮出Claude Opus 5.5,性能追平Fable 5.1的同時,成本只有上代Opus 5的六成。

16 分鐘前

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言

該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

48 分鐘前