DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs

重點摘要
首頁 > 智能時代>人工智能 DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs 2026/7/22 14:20:55 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,英偉達昨日(7 月 21 日)發佈博文,宣佈其 Blackw。
英偉達於昨日(7 月 21 日)正式發表博文,宣布其 Blackwell GB300 平台在混合專家模型(MoE)預訓練任務中創下全新世界紀錄,每顆 GPU 的算力高達 1648 TFLOPs(每秒萬億次浮點運算)。這項成果不僅展現了 Blackwell 架構的強大效能,也為大型語言模型的訓練效率樹立了新的標竿。 混合專家模型(MoE)是一種先進的機器學習架構,其核心概念是將大型模型拆分為多個較小的「專家」子網路,在每次推理或訓練過程中僅啟動其中一部分專家。這樣的設計讓模型能夠在保持龐大容量的同時,大幅降低計算成本,因此被廣泛應用於當前的大語言模型,以提升訓練與推理效率。而所謂的模型預訓練,則是指在大量未標註的數據集上,透過自監督學習方法,讓模型初步掌握語言規律、語意特徵或常識知識,這是打造高階 AI 模型不可或缺的基礎環節。 根據英偉達官方公布的資訊,此次創紀錄的測試是在 256 顆 GPU 的配置下,對 DeepSeek-v3 671B 模型進行預訓練。結果顯示,GB300 NVL72 系統達到了每顆 GPU 1648 TFLOPs 的吞吐量,刷新了 MoE 預訓練的世界紀錄。值得注意的是,與過去同類訓練任務相比,GB300 NVL72 使用了更少的 GPU 硬體,卻能達成相同的模型性能,凸顯出 Blackwell 架構在資源利用效率上的顯著優勢。 這項里程碑並非一蹴可幾。英偉達透露,在過去六個多月的時間裡,團隊透過模擬超過 25 萬種不同的系統配置,為 Blackwell 平台摸索並發現了多達 38 項重大優化方案。這些優化累計使用了 140 萬小時的 GPU 測試時間,才得以將系統潛力徹底釋放。相較於 2025 年 11 月進行的預訓練測試——當時的成績為每 GPU 1088 TFLOPs——如今的 GB300 NVL72 系統性能提升了整整 50%,進步幅度相當驚人。 背景來看,DeepSeek-v3 671B 是一個擁有 6710 億參數的巨型語言模型,其訓練難度極高,對 GPU 的算力、記憶體頻寬以及系統互連效率都有嚴苛要求。英偉達此次選用該模型作為測試基準,正是為了證明 Blackwell GB300 在處理超大規模 MoE 模型時的實力。透過 256 顆 GPU 的協同運算,不僅成功完成預訓練任務,更創下每 GPU 1648 TFLOPs 的紀錄,這意味著整體系統的算力利用率已達到相當高的水準。 在技術細節上,英偉達強調,這些優化涵蓋了底層硬體調度、通訊協定、記憶體訪問模式以及模型並行策略等多個層面。38 項重大優化方案是經過大規模模擬與反覆驗證後篩選出來的,每一項都對系統性能的提升有具體貢獻。140 萬小時的 GPU 測試更顯示出英偉達對 Blackwell 架構的重視程度,以及其在 AI 基礎設施領域持續投入的決心。 從市場角度來看,Blackwell GB300 在 MoE 預訓練上的突破,對於正在競逐大型語言模型訓練能力的雲端服務商、AI 研究機構以及企業用戶而言,無疑是一項重大利多。更少的 GPU 數量就能達到相同甚至更好的訓練效果,意味著能大幅降低硬體採購成本、電力消耗與資料中心空間需求,進而加速 AI 模型的迭代週期。 英偉達此次公布的成果,也為下一代 AI 加速器的設計方向提供了參考。MoE 架構的普及,使得 GPU 不僅需要強大的純計算能力,更需要在稀疏計算、動態路由以及專家選擇等環節上具備高度靈活性。Blackwell GB300 正是在這些方面進行了針對性的優化,才得以在 DeepSeek-v3 671B 的預訓練中脫穎而出。 目前,英偉達尚未宣布該測試結果的具體應用時間表,但業界普遍預期 Blackwell GB300 將在未來幾個月內陸續導入各大雲端平台與企業級資料中心。隨著 AI 模型規模持續擴大,這類破紀錄的效能表現將成為衡量 GPU 競爭力的重要指標。而英偉達透過持續的軟硬體協同優化,再次證明其在 AI 運算領域的領導地位。
Related
相關文章

準確率最高 92%:英偉達推出 SVD 服務,可識別 AI 生成視頻
首頁 > 智能時代>人工智能 準確率最高 92%:英偉達推出 SVD 服務,可識別 AI 生成視頻 2026/7/22 15:50:33 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,英偉達昨日(7 月 21 日)發佈博文,宣佈推出合成視頻檢測器(Synthetic Video Detector,簡稱 SVD)服務,識別 AI 生成視頻的準確率高達 92%。

Kimi K3爆火引發“算力荒”,“不著急上市”的楊植麒急了?
Kimi K3爆火引發“算力荒”,“不著急上市”的楊植麒急了?雷達財經2026.07.22 14:32 · 來自江蘇全文4234字00:00 / 11:54Kimi K3爆火後,被譽為“AI六小虎”之一的月之暗面卻遭遇了“算力荒”。文 | 雷達財經,作者 | 周慧 編 | 孟帥Kimi K3爆火後,被譽為“AI六小虎”之一的月之暗面卻遭遇了“算力荒”。

三星更新 Galaxy Wearable 應用:重構主頁交互,優化錶盤瀏覽
首頁 > 智能時代>智能穿戴 三星更新 Galaxy Wearable 應用:重構主頁交互,優化錶盤瀏覽 2026/7/22 14:33:20 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,科技媒體 Android Authority 今天(7 月 22 日)發佈博文,報道稱在 Galaxy Unpacked 發佈會召開之前,三星已推送重新設計的 Galaxy Wearable 應用。

消息稱三星考慮按 200 億歐元估值向 Mistral AI 投資 10 億歐元
首頁 > IT資訊>業界 消息稱三星考慮按 200 億歐元估值向 Mistral AI 投資 10 億歐元 2026/7/22 14:07:53 來源:IT之家 作者:溯波(實習) 責編:溯波 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 7 月 22 日消息,英國《金融時報》早些時候報道稱,三星正考慮向法國人工智能初創企業 Mistral AI 進一步追加投資。三星的風險投資部門曾給予 Mistral AI 資金支持。

由於技術原因,DeepSeek 聯網搜索暫不可用
首頁 > 智能時代>人工智能 由於技術原因,DeepSeek 聯網搜索暫不可用 2026/7/22 13:50:28 來源:IT之家 作者:汪淼 責編:汪淼 評論: 感謝IT之家網友 我是好人呀、開欣最重要、StarX、腦腐 的線索投遞! IT之家 7 月 22 日消息,據IT之家小夥伴反饋,DeepSeek 今日出現了聯網搜索無法使用的情況,提示“由於技術原因,聯網搜索暫不可用”。

摩爾線程公佈萬卡級集群訓練成績 稱國產芯片可訓出前沿模型
摩爾線程於2026世界人工智能大會透露,其236B參數MoE模型已在國產萬卡級集群上完成從零到長窗口訓練的全流程,有效訓練時長佔比超過90%,並與國際主流GPU對比訓練,前3萬步平均相對誤差控制在萬分之六以內。此外,摩爾線程與北京大學合作訓練的5D世界模型連續37天在世界生成維度排名第一,驗證國產算力在高端模型訓練中的可用性。