IT之家模型更新

DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs

2026年7月22日 14:20
DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs

重點摘要

首頁 > 智能時代>人工智能 DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs 2026/7/22 14:20:55 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,英偉達昨日(7 月 21 日)發佈博文,宣佈其 Blackw。

站內 AI 整理稿

英偉達於昨日(7 月 21 日)正式發表博文,宣布其 Blackwell GB300 平台在混合專家模型(MoE)預訓練任務中創下全新世界紀錄,每顆 GPU 的算力高達 1648 TFLOPs(每秒萬億次浮點運算)。這項成果不僅展現了 Blackwell 架構的強大效能,也為大型語言模型的訓練效率樹立了新的標竿。混合專家模型(MoE)是一種先進的機器學習架構,其核心概念是將大型模型拆分為多個較小的「專家」子網路,在每次推理或訓練過程中僅啟動其中一部分專家。這樣的設計讓模型能夠在保持龐大容量的同時,大幅降低計算成本,因此被廣泛應用於當前的大語言模型,以提升訓練與推理效率。

而所謂的模型預訓練,則是指在大量未標註的數據集上,透過自監督學習方法,讓模型初步掌握語言規律、語意特徵或常識知識,這是打造高階 AI 模型不可或缺的基礎環節。根據英偉達官方公布的資訊,此次創紀錄的測試是在 256 顆 GPU 的配置下,對 DeepSeek-v3 671B 模型進行預訓練。結果顯示,GB300 NVL72 系統達到了每顆 GPU 1648 TFLOPs 的吞吐量,刷新了 MoE 預訓練的世界紀錄。值得注意的是,與過去同類訓練任務相比,GB300 NVL72 使用了更少的 GPU 硬體,卻能達成相同的模型性能,凸顯出 Blackwell 架構在資源利用效率上的顯著優勢。

這項里程碑並非一蹴可幾。英偉達透露,在過去六個多月的時間裡,團隊透過模擬超過 25 萬種不同的系統配置,為 Blackwell 平台摸索並發現了多達 38 項重大優化方案。這些優化累計使用了 140 萬小時的 GPU 測試時間,才得以將系統潛力徹底釋放。相較於 2025 年 11 月進行的預訓練測試——當時的成績為每 GPU 1088 TFLOPs——如今的 GB300 NVL72 系統性能提升了整整 50%,進步幅度相當驚人。背景來看,DeepSeek-v3 671B 是一個擁有 6710 億參數的巨型語言模型,其訓練難度極高,對 GPU 的算力、記憶體頻寬以及系統互連效率都有嚴苛要求。

英偉達此次選用該模型作為測試基準,正是為了證明 Blackwell GB300 在處理超大規模 MoE 模型時的實力。透過 256 顆 GPU 的協同運算,不僅成功完成預訓練任務,更創下每 GPU 1648 TFLOPs 的紀錄,這意味著整體系統的算力利用率已達到相當高的水準。在技術細節上,英偉達強調,這些優化涵蓋了底層硬體調度、通訊協定、記憶體訪問模式以及模型並行策略等多個層面。38 項重大優化方案是經過大規模模擬與反覆驗證後篩選出來的,每一項都對系統性能的提升有具體貢獻。

140 萬小時的 GPU 測試更顯示出英偉達對 Blackwell 架構的重視程度,以及其在 AI 基礎設施領域持續投入的決心。從市場角度來看,Blackwell GB300 在 MoE 預訓練上的突破,對於正在競逐大型語言模型訓練能力的雲端服務商、AI 研究機構以及企業用戶而言,無疑是一項重大利多。更少的 GPU 數量就能達到相同甚至更好的訓練效果,意味著能大幅降低硬體採購成本、電力消耗與資料中心空間需求,進而加速 AI 模型的迭代週期。英偉達此次公布的成果,也為下一代 AI 加速器的設計方向提供了參考。

MoE 架構的普及,使得 GPU 不僅需要強大的純計算能力,更需要在稀疏計算、動態路由以及專家選擇等環節上具備高度靈活性。Blackwell GB300 正是在這些方面進行了針對性的優化,才得以在 DeepSeek-v3 671B 的預訓練中脫穎而出。目前,英偉達尚未宣布該測試結果的具體應用時間表,但業界普遍預期 Blackwell GB300 將在未來幾個月內陸續導入各大雲端平台與企業級資料中心。隨著 AI 模型規模持續擴大,這類破紀錄的效能表現將成為衡量 GPU 競爭力的重要指標。而英偉達透過持續的軟硬體協同優化,再次證明其在 AI 運算領域的領導地位。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

剛剛

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

剛剛

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣

過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。

1 小時前