花幾百萬買的H100在「摸魚」?英偉達:別怪顯卡,是你的模型「長得醜」
重點摘要
頂級 GPU 躺平,只因模型不懂硬件邏輯 作者丨高允毅 編輯丨馬曉寧 上個月,一位做推薦系統的朋友找我大吐苦水。團隊花了大幾百萬,剛咬牙把模型搬上了 8 張 H100,滿心以為能輕鬆扛住流量。結果監控面板一拉,心涼了半截,GPU 利用率常年躺平在 40% 上下。他的第一反應是:“完了,老闆咱們還得加卡。”停!先捂緊錢包。 別總覺得是卡不夠。
花幾百萬買的H100在「摸魚」?英偉達:別怪顯卡,是你的模型「長得醜」
上個月,一位從事推薦系統開發的朋友向筆者大吐苦水。團隊好不容易咬牙花了大幾百萬,把模型搬上了8張NVIDIA H100 GPU,滿心以為能輕鬆扛住流量高峰。結果監控面板一拉,心涼了半截——GPU利用率常年躺平在40%上下。他的第一反應是:「完了,老闆咱們還得加卡。」但問題真的出在GPU不夠多嗎?事實上,模型跑不快,問題很可能根本不在GPU,而是你的模型在寫下第一行程式碼的設計之初,就沒有設計成能夠適配GPU的形狀。就在最近,NVIDIA親自下場,發布了一篇名為《AI Model Co-Design: Hardware-Friendly LLM Design》的技術部落格。
整篇文章洋洋灑灑,其實只想點醒行業一件事:別光顧著堆算力了,來看看你們是怎麼把頂級顯卡逼成「磨洋工」的吧。要讀懂NVIDIA這篇論文,得先認清GPU的真面目。可以把GPU想像成一個幹活極快的「超級大力士」——它的計算能力極強,每秒能完成幾十萬億次浮點運算。但這個大力士有個弱點:它非常依賴「食材」的供應節奏。如果食材(也就是資料)送得慢,大力士就只能空等,空轉的力氣全都浪費了。GPU的運算核心之所以能飛快運轉,仰賴的是記憶體頻寬與平行運算架構的完美配合。當模型中的矩陣乘法、注意力機制等運算被設計成連續、大塊、規律的計算模式時,GPU的運算單元可以幾乎不間斷地工作,利用率直逼90%甚至更高。
但反過來,如果模型包含大量不規則的資料存取、稀疏的注意力計算、或者頻繁的條件分支,GPU就會不斷停下來等待資料傳輸,就像廚師等菜下鍋,鍋鏟再快也沒用。NVIDIA在技術部落格中指出,當前許多大型語言模型(LLM)在設計時,只關注了模型在學術基準上的準確率,卻忽略了模型在實際硬體上運行的效率。這些模型往往採用動態的稀疏注意力、可變長度的序列處理、或者非對齊的矩陣維度,導致GPU的張量核心無法發揮最大效能。更糟的是,有些模型的記憶體存取模式非常碎片化,每一次存取都需要多次觸發快取缺失,讓GPU的記憶體子系統疲於奔命。這種「模型長得醜」的現象,具體表現在幾個層面。首先是模型結構的「形狀」問題。
現代GPU的張量核心對矩陣的維度非常敏感,尤其偏好維度為8的倍數的張量。如果模型中的隱藏層維度、注意力頭數、FFN中間層維度沒有對齊到這些「甜蜜點」,GPU就無法使用最高效的矩陣乘法指令,計算效率會大幅下降。例如,一個維度為4096的隱藏層,用4096或4096+64的GPU最佳化方案,效能差距可能高達20%以上。其次是注意力機制的設計。傳統的softmax注意力需要計算完整的注意力矩陣,這在長序列場景下會耗費大量記憶體和頻寬。許多新模型試圖用稀疏注意力或線性注意力來降低計算量,但如果稀疏模式不夠規律,GPU的平行計算能力反而會被浪費。
NVIDIA的部落格特別提到,硬體友善的設計應該採用「固定模式」的稀疏注意力,例如滑動視窗注意力或全域+局部注意力,這樣GPU可以預先載入資料並高效執行。第三是記憶體布局與資料流。模型在推理時,參數和快取(KV cache)的存取模式直接影響GPU利用率。如果模型的權重矩陣沒有按照記憶體對齊的方式儲存,或者KV cache的組織方式造成頻繁的記憶體搬移,GPU的計算單元就會長時間處於閒置狀態。NVIDIA建議採用「連續批次處理」與「記憶體合併存取」的技巧,讓資料從HBM(高頻寬記憶體)到SRAM(靜態隨機存取記憶體)的傳輸盡可能一次完成。
回到那位朋友的案例,團隊花了百萬級預算購入8張H100,卻只跑出40%的利用率,背後的原因很可能就是模型設計時完全沒有考慮硬體對齊。他們用的是某個開源的推薦模型,原始碼中的注意力機制採用的是動態稀疏模式,且隱藏層維度設定為4096+32的非標準維度。這導致H100的張量核心無法發揮全力,同時記憶體存取頻寬也因為不對齊而浪費了約30%。換句話說,不是H100不夠強,是模型讓H100有力使不出。NVIDIA在部落格中不僅點出問題,也給出了具體的解決方案。
他們提出「模型共設計」(Model Co-Design)的概念,強調在模型架構設計階段就應該與硬體工程師協作,確保模型中的每一層、每一個運算都能在目標GPU上高效執行。例如,在設計LLM時,可以優先選擇FlashAttention等記憶體高效的注意力實現,並將隱藏層維度、注意力頭數、FFN擴展因子都設計為64的倍數。此外,還可以採用「量化感知訓練」,讓模型在低精度(如FP8、INT8)下依然保持準確率,同時大幅提升GPU的吞吐量。這篇技術部落格釋出的時機也耐人尋味。
當前AI晶片市場競爭激烈,AMD、英特爾甚至新創公司都在追趕NVIDIA的硬體優勢,但NVIDIA的護城河不僅在於晶片本身,更在於它對軟體生態的深度掌控。透過點出「模型設計」這個關鍵瓶頸,NVIDIA等於在提醒整個行業:GPU的潛力遠未被釋放,問題不在硬體,在於軟體與模型的配合度。換句話說,只要模型設計得「好看」,現有的GPU就能再撐好幾年。當然,要讓模型工程師改變習慣並不容易。長期以來,AI研究界更重視模型在學術榜單上的分數,而非在真實硬體上的運行速度。但隨著大模型部署成本高漲,企業開始意識到,一個運算效率高、但準確率略低0.
1%的模型,在商業上可能遠比一個準確率極高但GPU利用率只有30%的模型更有價值。NVIDIA的這篇文章,正是從硬體巨頭的角度,向整個AI社群發出的「設計提醒」。總結來說,如果你發現花大錢買的H100或A100利用率總是上不去,別急著怪GPU,也別急著加購更多顯卡。先回頭審視你的模型結構:注意力機制是否規律?矩陣維度是否對齊?記憶體存取是否連續?KV cache是否經過最佳化?這些細節往往比單純堆疊算力更能直接提升吞吐量。NVIDIA已經把答案寫在了部落格裡,剩下的就看模型設計者願不願意放下「論文指標優先」的執念,改為擁抱「硬體友善」的設計哲學了。
畢竟,能讓GPU全力運轉的模型,才是真正「長得好看」的模型。
Related
相關文章

OpenAI首款AI硬件,為什麼是個沒有屏幕的「甜甜圈」
OpenAI與Jony Ive團隊合作的首款AI硬體,外型類似無螢幕的冰球大小圓環,被形容為金屬甜甜圈。這款設備定位為以AI為第一交互入口的計算設備,而非傳統智能音箱,售價可能落在300至400美元之間。
OpenAI 首款硬件真容浮現:冰球大小無屏設計,售價 300 至 400 美元
OpenAI首款硬件產品細節曝光,為一款無螢幕的智能音箱,外型類似冰球,售價約300至400美元,由OpenAI與前蘋果設計師Jony Ive的LoveFrom公司合作開發。該設備內建電池與攝影鏡頭,可支援手持使用並將視覺資訊傳給ChatGPT,實現多模態感知。此產品推出時正值蘋果對OpenAI提起商業機密訴訟,OpenAI內部評估其設計細節有望反駁侵權指控。

消息稱英偉達急尋中國 AI 基站供應商,與“下一個中際旭創”合作開發 6G 基站
NVIDIA正積極在中國尋找AI基站供應商,並有意與被視為「下一個中際旭創」的業者合作開發6G基站,顯示其從資料中心延伸至通訊基礎設施的布局。此舉凸顯NVIDIA對6G市場的重視,AI基站被視為整合邊緣運算與智慧調度的關鍵節點,但合作細節與技術方案尚未正式公布。
金剛GC3芯片重新定義視頻AI算力規則,國產RISC-V高端算力商業化提速
近日,第三屆中國計算機學會芯片大會(CCF Chip 2026)在太湖之濱無錫成功舉辦。會場中,兩院院士與頂尖工程師們的討論話題直指底層架構的“根技術”創新。一個核心追問被反覆推至臺前:當摩爾定律逼近物理極限,製程紅利日益稀薄,堆核心、拼頻率的老路越走越窄,是否該徹底換一條路走?換言之,與其在通用架構上不斷打補丁,能否從數據流動的本質出發,為特定場景原生設計一顆芯片?
把512 GiB閃存搬到xPU旁邊,HBF能打破推理內存牆?
HBM已經證明,通過堆疊和共封裝把存儲介質遷移至GPU附近,可以緩解AI計算中的數據搬運瓶頸。現在,SK海力士聯合閃迪,將類似的思路正式應用到NAND上,通過HBF將大容量閃存放到包括GPU在內的各類xPU旁,以緩解AI推理內存牆問題。近日,雙方通過OCP發佈《High Bandwidth Flash(HBF)High-Level Base Die Specification, Version 0.7.0》。

AI的錢,被誰賺走了?
AI 浪潮推動雲端服務供應商大舉擴建資料中心,背後龐大的資本支出正沿著供應鏈層層傳導,最終流向光模塊、晶片與伺服器業者。這條資金鏈路的起點是亞馬遜 AWS、微軟 Azure、Google Cloud 等雲端廠商,他們為了滿足訓練與推論大語言模型所需的算力,持續加碼採購 GPU 伺服器與高速網路設備,帶動上游零組件需求爆發。