DeepSeek R1 推理 AI 測試:英偉達 Vera Rubin NVL72 每兆瓦 Tokens 吞吐量提升 10 倍

重點摘要
英偉達宣布Vera Rubin NVL72已開始量產並在多家雲端服務商內部運行,在DeepSeek R1推理模型測試中,相較於GB200 NVL72,其每兆瓦Tokens吞吐量提升10倍。CoreWeave已完成業界首個Vera Rubin NVL72的上電與驗證工作。
在全球 AI 推理需求持續爆發的背景下,英偉達(NVIDIA)與合作夥伴 CoreWeave 聯合發布了一項備受關注的基準測試結果:基於 DeepSeek R1 推理模型的工作負載中,新一代機架級系統 Vera Rubin NVL72 在每兆瓦 Tokens 吞吐量上較上一代 GB200 NVL72 實現了高達 10 倍的提升。這項測試不僅驗證了新一代架構在能效與吞吐能力上的巨大飛躍,也為高強度智能體(Agentic AI)應用的規模化部署提供了全新標竿。英偉達官方於 7 月 21 日發表博文,正式宣布其 Vera Rubin 平台已邁入萬億級規模部署階段。
博文中指出,Vera Rubin NVL72 的產能正在加速提升,並且已在 CoreWeave、Google Cloud、Microsoft Azure 以及 Oracle Cloud Infrastructure 等多家頂級雲端服務商的內部環境中成功運行。為滿足全球客戶對算力日益增長的需求,英偉達已在 30 個國家布局超過 350 座工廠,建立了有史以來規模最大且最成熟的機架級供應鏈體系,確保 Vera Rubin 能夠快速、穩定地交付到全球數據中心。在這一系列部署中,CoreWeave 扮演了先鋒角色。
該公司於 7 月 21 日同步發文,宣布在 6 月初完成了業界首個 NVIDIA Vera Rubin NVL72 機架系統的上電與全功能驗證。這套端到端的機架級系統涵蓋了電源供應、液冷散熱、網路互連及計算單元等所有關鍵子系統,並已全部驗證通過並投入穩定運行。CoreWeave 強調,這是業界首次完整搭建並運行如此高密度的新一代架構,為後續大規模量產和部署奠定了堅實基礎。本次測試的核心載體是 DeepSeek R1,這款模型被視為當前驅動智能體 AI(Agentic AI)應用激增的代表性推理模型。智能體應用要求模型具備極高的實時響應能力與持續推理效率,因此對底層硬體的每瓦性能提出了嚴苛要求。
正是基於這一背景,CoreWeave 與英偉達在同步部署 Vera Rubin NVL72 與 Blackwell NVL72 平台後,立即選擇 DeepSeek R1 作為統一的測試工作負載,旨在真實反映新架構在實際生產場景中的表現。評估過程聚焦於兩個核心維度:每兆瓦 Tokens 吞吐量(Token Throughput per Megawatt)以及用戶或智能體所能體驗到的回應速度(即 TPS/User,衡量交互性)。前者直接影響數據中心的運營效益與能效比,後者則決定著終端應用的流暢度與實用性。
研究團隊在完全匹配的交互性目標條件下,對比了 Vera Rubin NVL72 與 GB200 NVL72(屬於上一代 Blackwell 體系)在相同 DeepSeek R1 負載下的表現。結果顯示,當將 TPS/User 保持在同一水準(即用戶感受到的響應速度完全一致)時,Vera Rubin NVL72 的每兆瓦 Tokens 吞吐量是 GB200 NVL72 的整整 10 倍。這意味著同樣消耗 1 兆瓦電力,Vera Rubin 能夠生成 10 倍於前一代的輸出 Token 量,同時完全不犧牲交互延遲。
這一突破性提升直接解決了當前大型推理模型部署中最核心的痛點——能源效率與用戶體驗之間的矛盾。每兆瓦 Tokens 吞吐量是衡量 AI 推理基礎設施真實效率的黃金指標。在算力需求暴漲但電力與冷卻資源日益緊絀的時代,這一數據的提升代表著運營成本的大幅下降與部署密度的指數級提高。Cloud 業者與大規模數據中心經營者可以藉此以更少的硬體投入與能耗成本,承載更龐大的推理流量,從而推動更多複雜智能體應用從試驗走向商業化落地。此項佳績的背後,是 Vera Rubin 架構在計算與記憶體互連層面的深刻變革。
雖然英偉達未在本次博文中揭露具體的微架構細節,但從能效躍升幅度來看,Vera Rubin NVL72 在張量核心利用率、高頻寬記憶體存取效率以及機架內互連頻寬等方面顯然進行了針對性最佳化。特別是在處理 DeepSeek R1 這類長上下文推理模型時,這些硬體層面的改進能夠更有效地減少閒置等待,將每一瓦電能都轉化為有效的計算輸出。從供應鏈層面看,英偉達已經為 Vera Rubin 的全球交付做好了充分準備。遍布 30 個國家的 350 餘座工廠負責從基板、電源模塊、液冷系統到完整機櫃的各環節生產與整合,形成了業界覆蓋最廣、成熟度最高的機架級交付網路。
英偉達強調,這是有史以來規模最大的一次機架系統量產計畫,確保合作夥伴能夠及時取得最新硬體以應對客戶不斷增長的推理需求。包括 CoreWeave 在內的多家雲端服務商都對 Vera Rubin NVL72 的初期表現給予高度評價。CoreWeave 技術團隊指出,從上電驗證到實際承載推理工作負載的過程極其順利,系統維持了卓越的穩定性,且即時功耗表現超出了預期。隨著測試成果的公布,外界也對該平台在更大集群規模下的可擴展性充滿期待,尤其是針對如微軟 Azure 與 Google Cloud 這類超大規模雲端環境中的部署表現。
從產業趨勢來看,Vera Rubin NVL72 的 10 倍能效提升不僅是硬體迭代的里程碑,更可能成為催化智能體 AI 走向主流的重要推手。當前,以 DeepSeek R1 為代表的推理模型正在迅速滲透自動程式碼生成、高階資料分析、自動化決策等領域,每一項應用都對每秒 Token 輸出量與能耗成本敏感。若能將每兆瓦吞吐能力提高一個量級,原先難以經濟化部署的場景將變得可行,從而加速整個 AI 生態的落地循環。
總結而言,英偉達 Vera Rubin NVL72 在 DeepSeek R1 測試中所取得的每兆瓦 Tokens 吞吐量 10 倍增長,既驗證了其新世代架構的巨大潛力,也為全球 AI 基礎設施的能效標準樹立了全新標杆。從 CoreWeave 的先行驗證到遍布全球的成熟供應鏈,再到與頂級雲端平台的緊密合作,Vera Rubin 正逐步從概念走向全面量產,並將在未來數年內深刻影響推理計算的成本結構與能力邊界。隨著越來越多智能體應用以此為基礎進行規模化部署,AI 的性能瓶頸正從算力供給轉向更高效的能耗利用,而 Vera Rubin 顯然已為此給出了明確的答案。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。