雷峰網AI硬體

花幾百萬買的H100在「摸魚」?英偉達:別怪顯卡,是你的模型「長得醜」

2026年7月23日 09:34

重點摘要

頂級 GPU 躺平,只因模型不懂硬件邏輯 作者丨高允毅 編輯丨馬曉寧 上個月,一位做推薦系統的朋友找我大吐苦水。團隊花了大幾百萬,剛咬牙把模型搬上了 8 張 H100,滿心以為能輕鬆扛住流量。結果監控面板一拉,心涼了半截,GPU 利用率常年躺平在 40% 上下。他的第一反應是:“完了,老闆咱們還得加卡。”停!先捂緊錢包。 別總覺得是卡不夠。

站內 AI 整理稿

花幾百萬買的H100在「摸魚」?英偉達:別怪顯卡,是你的模型「長得醜」

上個月,一位從事推薦系統開發的朋友向筆者大吐苦水。團隊好不容易咬牙花了大幾百萬,把模型搬上了8張NVIDIA H100 GPU,滿心以為能輕鬆扛住流量高峰。結果監控面板一拉,心涼了半截——GPU利用率常年躺平在40%上下。他的第一反應是:「完了,老闆咱們還得加卡。」但問題真的出在GPU不夠多嗎? 事實上,模型跑不快,問題很可能根本不在GPU,而是你的模型在寫下第一行程式碼的設計之初,就沒有設計成能夠適配GPU的形狀。就在最近,NVIDIA親自下場,發布了一篇名為《AI Model Co-Design: Hardware-Friendly LLM Design》的技術部落格。整篇文章洋洋灑灑,其實只想點醒行業一件事:別光顧著堆算力了,來看看你們是怎麼把頂級顯卡逼成「磨洋工」的吧。 要讀懂NVIDIA這篇論文,得先認清GPU的真面目。可以把GPU想像成一個幹活極快的「超級大力士」——它的計算能力極強,每秒能完成幾十萬億次浮點運算。但這個大力士有個弱點:它非常依賴「食材」的供應節奏。如果食材(也就是資料)送得慢,大力士就只能空等,空轉的力氣全都浪費了。 GPU的運算核心之所以能飛快運轉,仰賴的是記憶體頻寬與平行運算架構的完美配合。當模型中的矩陣乘法、注意力機制等運算被設計成連續、大塊、規律的計算模式時,GPU的運算單元可以幾乎不間斷地工作,利用率直逼90%甚至更高。但反過來,如果模型包含大量不規則的資料存取、稀疏的注意力計算、或者頻繁的條件分支,GPU就會不斷停下來等待資料傳輸,就像廚師等菜下鍋,鍋鏟再快也沒用。 NVIDIA在技術部落格中指出,當前許多大型語言模型(LLM)在設計時,只關注了模型在學術基準上的準確率,卻忽略了模型在實際硬體上運行的效率。這些模型往往採用動態的稀疏注意力、可變長度的序列處理、或者非對齊的矩陣維度,導致GPU的張量核心無法發揮最大效能。更糟的是,有些模型的記憶體存取模式非常碎片化,每一次存取都需要多次觸發快取缺失,讓GPU的記憶體子系統疲於奔命。 這種「模型長得醜」的現象,具體表現在幾個層面。首先是模型結構的「形狀」問題。現代GPU的張量核心對矩陣的維度非常敏感,尤其偏好維度為8的倍數的張量。如果模型中的隱藏層維度、注意力頭數、FFN中間層維度沒有對齊到這些「甜蜜點」,GPU就無法使用最高效的矩陣乘法指令,計算效率會大幅下降。例如,一個維度為4096的隱藏層,用4096或4096+64的GPU最佳化方案,效能差距可能高達20%以上。 其次是注意力機制的設計。傳統的softmax注意力需要計算完整的注意力矩陣,這在長序列場景下會耗費大量記憶體和頻寬。許多新模型試圖用稀疏注意力或線性注意力來降低計算量,但如果稀疏模式不夠規律,GPU的平行計算能力反而會被浪費。NVIDIA的部落格特別提到,硬體友善的設計應該採用「固定模式」的稀疏注意力,例如滑動視窗注意力或全域+局部注意力,這樣GPU可以預先載入資料並高效執行。 第三是記憶體布局與資料流。模型在推理時,參數和快取(KV cache)的存取模式直接影響GPU利用率。如果模型的權重矩陣沒有按照記憶體對齊的方式儲存,或者KV cache的組織方式造成頻繁的記憶體搬移,GPU的計算單元就會長時間處於閒置狀態。NVIDIA建議採用「連續批次處理」與「記憶體合併存取」的技巧,讓資料從HBM(高頻寬記憶體)到SRAM(靜態隨機存取記憶體)的傳輸盡可能一次完成。 回到那位朋友的案例,團隊花了百萬級預算購入8張H100,卻只跑出40%的利用率,背後的原因很可能就是模型設計時完全沒有考慮硬體對齊。他們用的是某個開源的推薦模型,原始碼中的注意力機制採用的是動態稀疏模式,且隱藏層維度設定為4096+32的非標準維度。這導致H100的張量核心無法發揮全力,同時記憶體存取頻寬也因為不對齊而浪費了約30%。換句話說,不是H100不夠強,是模型讓H100有力使不出。 NVIDIA在部落格中不僅點出問題,也給出了具體的解決方案。他們提出「模型共設計」(Model Co-Design)的概念,強調在模型架構設計階段就應該與硬體工程師協作,確保模型中的每一層、每一個運算都能在目標GPU上高效執行。例如,在設計LLM時,可以優先選擇FlashAttention等記憶體高效的注意力實現,並將隱藏層維度、注意力頭數、FFN擴展因子都設計為64的倍數。此外,還可以採用「量化感知訓練」,讓模型在低精度(如FP8、INT8)下依然保持準確率,同時大幅提升GPU的吞吐量。 這篇技術部落格釋出的時機也耐人尋味。當前AI晶片市場競爭激烈,AMD、英特爾甚至新創公司都在追趕NVIDIA的硬體優勢,但NVIDIA的護城河不僅在於晶片本身,更在於它對軟體生態的深度掌控。透過點出「模型設計」這個關鍵瓶頸,NVIDIA等於在提醒整個行業:GPU的潛力遠未被釋放,問題不在硬體,在於軟體與模型的配合度。換句話說,只要模型設計得「好看」,現有的GPU就能再撐好幾年。 當然,要讓模型工程師改變習慣並不容易。長期以來,AI研究界更重視模型在學術榜單上的分數,而非在真實硬體上的運行速度。但隨著大模型部署成本高漲,企業開始意識到,一個運算效率高、但準確率略低0.1%的模型,在商業上可能遠比一個準確率極高但GPU利用率只有30%的模型更有價值。NVIDIA的這篇文章,正是從硬體巨頭的角度,向整個AI社群發出的「設計提醒」。 總結來說,如果你發現花大錢買的H100或A100利用率總是上不去,別急著怪GPU,也別急著加購更多顯卡。先回頭審視你的模型結構:注意力機制是否規律?矩陣維度是否對齊?記憶體存取是否連續?KV cache是否經過最佳化?這些細節往往比單純堆疊算力更能直接提升吞吐量。NVIDIA已經把答案寫在了部落格裡,剩下的就看模型設計者願不願意放下「論文指標優先」的執念,改為擁抱「硬體友善」的設計哲學了。畢竟,能讓GPU全力運轉的模型,才是真正「長得好看」的模型。

Related

相關文章

蘋果Mac將迎來全線換代,一種給人用,一種給AI用

蘋果預計將對旗下Mac產品線進行全面換代,根據業界消息,此次更新將不再只是單純的硬體規格升級,而是針對不同使用場景推出截然不同的產品類型。據了解,新一代Mac將劃分為兩大路線:一類專為人類使用者日常操作與創作需求設計,另一類則完全聚焦於人工智慧運算任務,顯示蘋果在AI領域的布局正在加速落地。 這項產品策略的背後,反映出蘋果對Mac未來定位的深刻調整。

剛剛
IT之家AI硬體

英偉達加速 AI 算力供應:Grace 芯片累計交付超 250 萬顆,Vera Rubin 機架目標日產 1000 臺

根據科技媒體 Wccftech 昨日(7 月 22 日)報導,英偉達正在加速推進其 CPU 路線圖,以強化身為全棧系統供應商的市場地位,進一步擴大 AI 算力的供應規模。此舉展現出該公司從芯片設計到系統整合的垂直布局意圖。 在具體進展部分,英偉達的 Grace 芯片累計交付量已突破 250 萬顆,顯示其在 AI 運算領域的強勁需求與產能動能。

2 小時前
AIBaseAI硬體

本地跑通 1000 億參數大模型:Acrab 發佈邊緣 AI 芯片 GΞLIX 1,5nm 製程撐起 650TOPS

AI資訊AI新閒資訊正文本地跑通 1000 億參數大模型:Acrab 發佈邊緣 AI 芯片 GΞLIX 1,5nm 製程撐起 650TOPS發布於AI新閒資訊時間 :Jul 23, 2026閱讀 :1分鐘一家叫 Acrab 的初創公司,今天正式把它的第一款邊緣 AI 終端 SoC 端上了檯面——GΞLIX 1。這塊基於 5nm 製程的芯片,主打一個硬指標:能讓 1000 億參數規模的大模型,直接在本地跑起來,不必把數據送去雲端。

6 小時前6900
雷峰網AI硬體

剛剛,智譜建了一座只用國產芯片的數據中心

AI 大廠正從「訓練模型」走向「建設計算工廠」。 作者丨鄭佳美 編輯丨馬曉寧 過去兩年,全球人工智能行業最搶手的東西,是英偉達 GPU。從 OpenAI 到 Meta,再到 Google、Amazon,幾乎所有希望在 AI 領域佔據優勢的公司,都在爭奪計算資源。行業最初盯著模型能力,後來逐漸發現,模型背後的那套“機器”,同樣決定著迭代速度。算法可以調整,數據可以補充,算力中心卻不能臨時搭建。

8 小時前
鈦媒體AI硬體

AI競爭,為什麼先比算力?

AI競爭,為什麼先比算力?反熵2026.07.22 16:32 · 來自北京全文3509字00:00 / 11:13AI越接近落地,算力基礎設施越重要。文 | 反熵今年WAIC最熱鬧的展區是機器人,最安靜卻同樣受到關注的展品,當屬一排排算力機櫃。華為、阿里、百度、中興、沐曦等廠商集中展示超節點和算力集群,算力與具身智能也成為大會兩條最清晰的產業主線。

20 小時前