英偉達Vera Rubin的Agent吞吐暴漲最高提升30倍,卻不只靠GPU | Hot Chips 2026
在Agent推理上,英偉達又把性能往前推了一大步。Hot Chips 2026期間,英偉達披露了Vera Rubin NVL72最新Agent工作負載測試結果:在DeepSeek V4-Pro、單用戶每秒160 Token的測試條件下,相比GB300 NVL72,每兆瓦吞吐最高提升30倍。但比30倍更值得關注的是,英偉達這次提升Agent推理效率,已經不再只依賴一顆更快的GPU。
面對長上下文、低延遲Token生成、工具調用和數據交互同時出現的Agent工作負載,英偉達正在把一次推理拆成不同類型的計算任務:Vera Rubin NVL72承擔大規模模型計算,Groq 3 LPX專攻低延遲Token生成,Vera CPU處理工具編排、代碼執行和數據處理,Spectrum-X則負責把這些計算、數據和存儲資源連接起來。換句話說,Agent工作負載讓性能問題不再停留在一次模型計算內部,而是沿著上下文、生成、工具執行和基礎設施訪問繼續向外擴展。
從GPU、CPU到專用推理芯片和網絡,英偉達在Hot Chips展示的已經不只是一代芯片的性能提升,而是一套針對Agent工作負載重新劃分計算邊界的系統架構。超長上下文實測,Rubin把Agent推理拉進真實長任務這次Hot Chips上,英偉達給出了一組更貼近Agent工作流的Rubin實測數據。英偉達此次測試採用SemiAnalysis AgentX工作負載。AgentX基於真實Agent編程會話的流量軌跡,在去除原始 prompt、代碼、工具參數和結果後,保留請求長度、上下文增長、工具暫停、子任務依賴和時序等負載特徵。此次測試的中位輸入上下文超過 14 萬 Token。
按照英偉達測得、目前仍待SemiAnalysis審核的結果,在DeepSeek V4-Pro工作負載、單用戶每秒160 Token的交互速度下,Vera Rubin NVL72相較GB300 NVL72最高實現30倍的每兆瓦吞吐。Vera Rubin 在 160 交互性下,每兆瓦的吞吐量提高了 30 倍。(圖源:英偉達技術博客)英偉達HPC與AI超大規模基礎設施解決方案高級總監Dion Harris指出,傳統推理基準通常圍繞“單一、可預測的請求”設計:輸入和輸出相對確定,因此可以比較Token生成速度、吞吐量等指標。但Agent任務會跨越多輪操作,而且每一步的工作負載都可能變化。
Harris續指,傳統推理負載可以使用8K甚至32K的輸入序列進行測試,但到了遞歸式、多輪Agent任務中,Prefill需要處理的上下文會隨著每一次迭代持續增長,因此平臺評估需要開始考慮數十萬Token級別的輸入。原因在於,Agent完成一項任務時,模型可能不斷讀取文件、調用工具、執行代碼,再把新的結果寫回上下文,進入下一輪推理。AgentX 測的是推理服務基礎設施面對 Agent 流量形態時的表現,不是測 Agent 任務完成質量。這也是此次Rubin測試採用超過14萬Token上下文的意義。
換言之,14萬Token的意義並不只是“輸入更長”,而是測試對象開始從靜態prompt轉向動態任務軌跡。它試圖回答的不再只是“一次模型推理能夠跑多快”,而是在更接近Agent實際運行軌跡的長鏈路負載下,系統還能維持怎樣的性能。與此同時,英偉達把兩個指標放在了同一張性能曲線上:橫軸是單個用戶每秒獲得的Token數量,即交互速度;縱軸則是固定電力預算下整套系統能夠處理的Token數量,即每兆瓦吞吐。在多輪代理會話中,每輪對話所包含的上下文信息穩步增加。
(圖源:英偉達技術博客)這兩個指標對應著Agent推理中兩個不同的性能目標:一邊是提高單個用戶在 Token 生成階段的交互速度,另一邊則是在有限電力條件下承載更多推理負載。因此,這組數據更值得關注的是,當Agent進入硬件實測之後,長上下文、總體吞吐和交互速度開始被放到同一個性能問題中討論。而當同一套推理系統需要同時優化這些目標時,下一個問題也隨之出現:這些任務,是否仍然適合全部交給同一種處理器完成?加入LPX,GPU不再是AI推理環節的最佳架構?這種性能目標的分化,正在直接反映到推理芯片的架構上。英偉達透露,Groq 3 LPX已經進入全面生產。
按照Artificial Analysis的測試,在Gemma 4 31B、10萬Token上下文這一特定負載下,Groq 3 LPX輸出速度達到每秒3400個Token,英偉達稱其響應速度達到最接近替代方案的4倍。LPX瞄準的並不是“大模型推理”這個籠統的問題,而是其中一個更具體的瓶頸:低延遲Token生成。Prefill需要並行處理大量輸入Token,通常更偏計算密集型;Decode則需要一個Token接一個Token生成,並持續讀取模型權重和KV Cache,因此通常更受內存帶寬和單步延遲限制。
英偉達也把Agentic AI面對的計算挑戰拆成了兩個方向:一邊是高效處理越來越大的上下文,另一邊是以極低延遲生成Token。Groq 3 LPX針對的是後一個方向,但需要注意,這並不意味著英偉達正在用LPX替代GPU。GPU與LPX之間並不存在一種固定的任務切分方式。
在最直接的 Prefill-Decode 拆分中,Vera Rubin NVL72 處理輸入上下文並生成 KV Cache,LPX 則參與後續 Decode 階段的低延遲生成;另一種方案則把Decode內部繼續拆開,由Rubin負責Attention計算並持有KV Cache,LPX負責FFN計算;此外,還可以讓LPX運行一個較小的draft model提前生成候選Token,再由Rubin上的大模型進行驗證,即推測解碼。這三種方案的數據流和計算分工不同,但背後的邏輯是一致的:並不是先決定一次推理應該由GPU還是LPU完成,而是把推理內部進一步拆成性質不同的計算任務,再交給更適合的處理器執行。
英偉達稱,Groq 3 LPX 擴展了 Vera Rubin 平臺的功能,使其能夠支持具有高交互性的智能體 AI 工作負載。(圖源:英偉達技術博客)這也產生了一個問題,將Groq 3 LPX加入Vera Rubin,是否意味著GPU已經不再是所有AI推理環節的最佳架構?Harris給出的解釋是,“為工作負載的不同部分選擇合適的處理器”。他認為,Rubin GPU仍然提供最靈活的吞吐和交互能力,覆蓋更廣泛的工作負載;LPX則進一步把系統推向對極低延遲要求更高的場景。
因此,LPX真正值得關注的並不是英偉達又多了一顆芯片,它反映的是,在Vera Rubin這套系統裡,原本由通用GPU統一承接的不同性能目標正在被進一步拆開:GPU繼續承擔覆蓋範圍更廣的模型計算,而專用加速器則圍繞Token生成延遲等具體瓶頸補位。這也解釋了為什麼Agent工作負載下更細的異構分工,並不意味著GPU的重要性下降。恰恰相反,GPU仍然位於計算中心,只是圍繞它,不同處理器的任務邊界正在變得更加明確。從GPU到CPU和網絡,英偉達開始優化整條Agent鏈路如果說GPU與LPX的分工仍然發生在模型推理內部,那麼Agent帶來的下一層變化,是性能瓶頸繼續延伸到模型調用之外。
傳統大模型服務中,一次模型輸出往往就是任務的終點。Agent並不是這樣。模型完成一輪推理後,還可能繼續調用搜索、數據庫或其他軟件工具,執行代碼、處理返回結果,再把新的信息送回模型,進入下一輪推理。這意味著,決定一次Agent任務速度的,已經不只是GPU完成模型計算需要多少時間。Harris提到,Agent正在增加模型調用之間的CPU負載:工具編排、代碼執行、數據處理和模擬,都需要CPU參與。這也是英偉達此次強調Vera CPU的原因。Vera在這裡承擔的並不是模型計算本身,而是兩次模型調用之間那些仍然需要CPU完成的任務。
類似的變化也發生在網絡層,當Agent不斷訪問工具、數據和存儲時,網絡面對的不再只有GPU之間的數據交換。用戶、Agent、應用、數據源和存儲服務需要持續發生交互,計算系統與這些基礎設施之間的連接同樣可能進入任務的關鍵路徑。在這樣的背景下,這英偉達此次提出了Scale-In。與通過NVLink連接機架內GPU的Scale-Up,以及通過Spectrum-X連接更大規模GPU集群的Scale-Out不同,Scale-In針對的是傳統數據中心中的南北向基礎設施流量,由BlueField-4和DOCA承擔網絡、存儲訪問、安全、控制平面和可觀測等任務,再通過Spectrum-X接入整套計算基礎設施。
與 Scale-In 處理模型調用之外的基礎設施訪問不同,Spectrum-X Multiplane 解決的是另一類更普遍的問題:隨著 GPU 集群規模擴大,網絡本身的擴展能力和故障恢復開始直接影響計算資源能否持續被利用。Spectrum-X Multiplane通過多個獨立網絡平面擴大兩層網絡的規模,並在單一路徑出現故障時進行硬件級重新路由。按照英偉達給出的數據,該架構最高可擴展至51.2萬張GPU;在八平面拓撲中,一個平面失效後仍可維持約90%的總帶寬,故障恢復速度較軟件方案提高11倍。Scale-In和Spectrum-X Multiplane解決的並不是同一個網絡問題。
Scale-In處理計算系統與數據、存儲和基礎設施服務之間的連接與管理需求;Multiplane則解決更大規模GPU集群的網絡擴展和故障恢復問題。但放回完整的Agent任務鏈中,兩者指向同一個變化:決定任務效率的環節正在從一次模型計算不斷向外延伸。GPU可以更快地完成模型計算,LPX可以進一步壓低Token生成延遲;但如果Agent隨後卡在工具執行、數據讀取或者通信上,前面獲得的計算性能仍然會被等待時間消耗掉。Agent改變的不只是推理芯片內部的分工,也在擴大AI基礎設施需要優化的範圍。這並非意味著未來每一個Agent系統都會配置LPX、Vera這樣的CPU和如此大規模的網絡基礎設施。
英偉達此次展示的明顯是面向高併發、長上下文和大規模部署的上限設計,它最終能夠形成多大的實際市場,仍然取決於Agent應用能夠產生怎樣的真實負載,以及更復雜的異構系統能否換來足夠的性能收益。從Hot Chips此次英偉達展示出的架構邏輯來看,一個趨勢已經比較清楚:GPU仍然是AI計算的核心。只是當一次Agent任務橫跨上下文處理、Token生成、工具執行和數據通信,下一代推理基礎設施要優化的對象,已經不再是一顆芯片,而是整條任務鏈。【封面圖片來源:網站名英偉達官網,所有者:英偉達】
Related
相關文章

HappyHorse與Wan3.0賽馬,誰是阿里版Seedance?
中國 AI 影片生成賽道的競爭進入新階段,阿里巴巴旗下的通義千問團隊近期動作頻頻,其影片生成模型「萬相」(Wan)持續迭代,而與此同時,市場上出現了一款名為 HappyHorse 的產品,憑藉其獨特的風格化表現與高品質輸出,迅速在創作者圈層中累積口碑。兩者之間的比較,尤其是「誰才是阿里版 Seedance」的討論,成為近期 AI 圈最熱門的話題之一。這不僅是兩款產品的對決,更折射出中國 AI 大模型公司在面對 OpenAI Sora 等國際對手時,如何走出差異化路線的戰略思考。

抽成 30%,消息稱月之暗面正就 Kimi K3 AI 模型與微軟、亞馬遜、谷歌開展收入分成談判
作者:沁滄(實習) 責編:沁滄 評論: 8 月 26 日消息,據路透社報道,三位知情人士透露,人工智能初創公司月之暗面正與微軟、亞馬遜以及 Alphabet 旗下的谷歌洽談營收分成協議。該協議將允許這幾家美國雲計算巨頭託管其旗艦模型 Kimi K3。

Cloudflare 稱 AI 智能體已佔 60% 互聯網流量,同比激增 1700%
作者:故淵 責編:故淵 評論: 8 月 26 日消息,韓媒 chosun 昨日(8 月 25 日)發佈博文,報道稱 Cloudflare 亞太區執行副總裁兼董事總經理 Goran Risticsevich 表示,由 AI 智能體產生的流量在過去 1 年中激增逾 1,700%,目前約佔總流量的 60%。

Artificial Analysis 公佈蘋果 iPhone 17 Pro 跑 8GB 以內本地 AI 性能排名
作者:故淵 責編:故淵 評論: 8 月 26 日消息,Artificial Analysis 於 8 月 24 日發佈博文,宣佈攜手 Liquid AI,發佈面向手機端的 AI 跑分基準,重點關注 AI 模型在蘋果 iPhone 17 Pro 上的表現。

宇樹智元共用一個大腦!神秘模型Demo炸場,10分鐘一鏡到底
一段長達10分鐘、一鏡到底的機器人實測影片曝光,畫面中宇樹與智元兩款硬體架構迥異的機器人,竟能共用同一個「大腦」並互相協作,完成擦窗、搬箱墊高、中斷後恢復等長程任務。影片全程無剪輯、無遙控、無人工指令,被視為全球罕見的跨本體通用大腦樣本,可能顛覆具身智慧產業的技術判斷與Scaling Law認知。

實測豆包工作:WorkBuddy迎來最強對手?
實測豆包工作:WorkBuddy迎來最強對手?AIX財經2026.08.26 10:00 · 來自福建全文4573字00:00 / 14:08一週補全能力,豆包工作好用嗎?文 | AIX財經,作者 | 雷晶,編輯 | 金璵璠8月25日,字節跳動正式發佈AI辦公Agent產品豆包工作。豆包工作的模型提供自動、豆包2.1 Pro和豆包2.1 Turbo三種選擇,用戶可以根據任務複雜度選擇不同能力。使用入口也比較多,既可以下載獨立App,也可以直接在豆包APP的工作任務區使用,還能從飛書內調用。相比市面上的同類Agent應用,豆包工作最大的特點在於與飛書深度打通,可以在權限範圍內調用企業協作場景中的文檔、聊天記錄、會議紀要等信息,讓Agent參與到日常辦公任務中。在正式發佈之前,豆包用一週時間連續更新了多項辦公Agent能力。8月17日,手機遠程控制電腦上線,用戶可以通過手機訪問電腦文件,直接調取和處理分散在不同設備中的資料。8月18日,Windows虛擬桌面上線,AI可以在獨立環境中執行任務,避免影響用戶自己的電腦環境。8月20日,側邊工作臺上線,將本地文件、飛書文檔、網頁和代碼等內容集中到同一個工作空間。8月21日,技能商店、連接器和工作夥伴功能推出,讓用戶可以將常用流程沉澱下來,後續重複調用。這一系列更新補充了Agent進入辦公場景所需要的幾個環節,既能操作電腦和調用資料,也能在獨立環境中執行任務,還開始嘗試把一次性的操作沉澱為可複用流程。此外,字節也在調整AI辦公業務佈局。8月24日,有媒體爆出TRAE、釦子(Coze)團隊併入豆包體系,其中TRAE Work、釦子將與豆包在工作場景的產品能力進行整合,TRAE IDE及CLI則作為豆包品牌下的編程產品線繼續發展。在這一背景下,作為字節面向AI辦公場景推出的Agent產品,豆包工作實際效果體驗如何呢?我們來一起看看。01.