谷歌發佈八代TPU雙芯
重點摘要
Google 今日正式發表第八代 TPU 晶片,並首次針對不同工作負載推出兩款專用系統:TPU 8t 與 TPU 8i。這兩款晶片是 Google Cloud AI 超級電腦(AI Hypercomputer)的核心元件,分別針對大規模預訓練與即時推理服務進行最佳化,以因應從密集式大型語言模型(LLM)到混合專家模型(MoE)、乃至於具備長序列推理能力的 agentic AI 與世界模型的運算需求。 Google 在設計 TPU 時始終圍繞三大支柱:可擴展性、可靠性與效率。
Google 今日正式發表第八代 TPU 晶片,並首次針對不同工作負載推出兩款專用系統:TPU 8t 與 TPU 8i。這兩款晶片是 Google Cloud AI 超級電腦(AI Hypercomputer)的核心元件,分別針對大規模預訓練與即時推理服務進行最佳化,以因應從密集式大型語言模型(LLM)到混合專家模型(MoE)、乃至於具備長序列推理能力的 agentic AI 與世界模型的運算需求。 Google 在設計 TPU 時始終圍繞三大支柱:可擴展性、可靠性與效率。隨著 AI 模型從單純預測下一個 token 的架構,演進為能模擬未來情境、推論後果並透過「想像」學習的世界模型,硬體不能只增加浮點運算次數,必須針對不同階段的運算密集型任務提供專屬路徑。第八代 TPU 正是為此而生,確保從訓練的第一個 token 到多輪推理鏈的最後一步,都能在最高效率的路徑上執行。Google DeepMind 的 Genie 3 世界模型即仰賴此架構,讓數百萬個 agent 能在多樣化的模擬環境中練習並精進推理能力。 為因應預訓練、後訓練與即時推理在基礎設施需求上的明顯分歧,Google 將第八代 TPU 拆分為兩個獨立系統。兩者共享 Google AI 堆疊的核心基因,並均整合 Arm 架構的 Axion CPU 作為主機端,以消除資料準備延遲造成的瓶頸,確保 TPU 不會因等待資料而停滯。 **TPU 8t:預訓練效能怪獸**
TPU 8t 專為大規模預訓練與大量嵌入(embedding)工作負載所設計,沿用 Google 成熟的 3D Torus 網路拓樸,並將單一 Superpod 內的晶片數量擴展至 9,600 顆。其關鍵革新包括:內建 SparseCore 專用加速器,專門處理嵌入查詢中不規則的記憶體存取模式,避免一般通用晶片常見的零運算瓶頸;同時透過更平衡的向量處理單元(VPU)與矩陣乘法單元(MXU)重疊執行,讓量化、softmax 與層歸一化等作業能與矩陣乘法並行,最大化晶片使用率。 TPU 8t 更導入原生 4 位元浮點格式(FP4),在維持大型模型準確度的前提下,將 MXU 吞吐量提升一倍,同時降低記憶體頻寬壓力與資料搬運的能耗,使更大規模的模型層能完整放入晶片內建緩衝區。在網路方面,Google 為 TPU 8t 全新打造 Virgo 網路架構,採用高埠數交換器與扁平化雙層非阻塞拓樸,將資料中心網路(DCN)頻寬提升至前一代的 4 倍,並將晶片間互連(ICI)頻寬提升 2 倍。Virgo 網路可連結超過 13.4 萬顆 TPU 8t 晶片,在單一 Fabric 中提供高達 47 Pb/s 的非阻塞雙向頻寬,並實現超過 1.7K ExaFlops 的效能,且為近線性擴展。 此外,TPU 8t 引入 TPUDirect RDMA 與 TPUDirect Storage 技術。前者允許 TPU 的高頻寬記憶體(HBM)直接與網路介面卡(NIC)交換資料,繞過主機 CPU 與 DRAM;後者則讓 TPU 直接存取高速託管儲存(如 10T Lustre),使訓練資料能以線速直接送入晶片,避免資料攝取瓶頸。與第七代 Ironwood TPU 相比,儲存存取速度提升達 10 倍。 **TPU 8i:推理與服務專家**
TPU 8i 則針對後訓練與高並發推理最佳化,配備 Google 歷來最大量的晶片內 SRAM(384 MB,為前一代 3 倍),可將更大的 KV 快取完全放在晶片上,顯著降低長序列解碼時的核心閒置時間。其核心創新是全新的 Collectives Acceleration Engine(CAE),專門加速自回歸解碼與思維鏈(chain-of-thought)處理中的歸約與同步步驟,將晶片內集體通訊的延遲再降低 5 倍。 TPU 8i 採用全新的 Boardfly 網路拓樸,取代傳統的 3D Torus。Boardfly 基於高埠數設計,將晶片以全連接板卡形式組成群組,再透過光學電路交換器(OCS)聚合為 Pod,最多可連結 1,152 顆晶片,並將最大網路直徑從 3D Torus 的 16 跳(以 1,024 晶片規模計算)大幅縮減至僅 7 跳,降幅達 56%。這對於混合專家模型與推理模型中頻繁發生的全對全通訊(all-to-all)而言,能直接降低尾延遲,讓 CAE 無需等待資料橫跨整個 Pod 送達。 **軟體與擴展性**
硬體效能離不開軟體驅動。第八代 TPU 延續從第七代 Ironwood 開始的效能優先軟體堆疊,提供 Pallas 自訂內核語言與 Mosaic 框架,讓開發者能撰寫硬體感知的內核,同時保有高階框架的抽象便利性。Google 並透過 JAX 與 Pathways 分散式訓練框架,可將單一訓練叢集擴展至超過 100 萬顆 TPU 晶片,實現近乎線性的效能擴展。 **規格一覽**
- **TPU 8t**:主要工作負載為大規模預訓練;網路拓樸為 3D Torus;專用晶片功能為 SparseCore(嵌入)與 LLM 解碼引擎;HBM 容量 216 GB;晶片內 SRAM 128 MB;峰值 FP4 效能 12.6 PFLOPs;HBM 頻寬 6,528 GB/s;主機端採用 Arm Axion CPU。 - **TPU 8i**:主要工作負載為取樣、服務與推理;網路拓樸為 Boardfly;專用晶片功能為 CAE(Collectives Acceleration Engine);HBM 容量 288 GB;晶片內 SRAM 384 MB;峰值 FP4 效能 10.1 PFLOPs;HBM 頻寬 8,601 GB/s(約為 TPU 8t 的 1.3 倍);主機端同樣採用 Arm Axion CPU。 第八代 TPU 的推出,標誌著 Google 在 AI 基礎設施上從通用加速走向任務專門化的關鍵一步,也為訓練與部署下一代世界模型、agentic AI 系統提供了更高效、可擴展的運算平台。
Related
相關文章

生成模型也能端到端訓練了?核心竟是一個for循環
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作生成模型也能端到端訓練了?核心竟是一個for循環機器之心·2026年08月03日 11:49參數和數據之後,生成模型解鎖預訓練第三根軸 2012 年,AlexNet 用一場壓倒性的勝利終結了一個時代。在此之前,做圖像識別要靠人手工設計一層層特徵提取的流程;AlexNet 證明瞭一件後來被反覆驗證的事:把整個任務端到端地交給模型自己學,幾乎總是打得過人類精心設計的分階段流水線。 從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都是同一句話:讓它自己一口氣學完。 只有一個領域始終是例外:生成模型。 今天最強、最能擴展的生成模型(無論是自迴歸還是擴散模型)都不是端到端的。 它們訓練時只學預測「一小步」,推理時卻要像循環網絡那樣把這一步反覆展開幾百上千次。 訓練和推理用的不是同一套採樣方式。這個裂縫帶來了一個老問題:每一步的誤差會喂進下一步,輸入逐漸漂離訓練時見過的分佈,誤差層層累積。學術上管它叫「暴露偏差」(exposure bias)。 換句話說,「端到端更好」這條深度學習最核心的經驗,十幾年來始終沒能真正落到生成模型頭上。 而就在最近,一篇來自 UIUC 與哈佛大學的論文,試圖把這塊最後的拼圖補上。 作者

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent
王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek
MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。

微信、支付寶會給豆包手機“開門”嗎?AI手機背後的入口之爭
如果這些規則沒有明確,即使技術接口存在,超級App們也沒有動力把最有價值的部分交給一個可能架空自己的外部Agent。如果豆包遲遲無法拿到阿里和騰訊等企業的深度授權,字節並非完全沒有退路。相比其他公司,字節最大的優勢之一,是它本身已經擁有一套規模龐大的互聯網產品生態。在內容領域,字節擁有抖音和今日頭條;在辦公與創作領域,擁有飛書、剪映等工具;在消費場景中,抖音電商和抖音生活服務也已經形成了相當規模的商品和本地商戶供給。

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek
MiniMax發布新一代多模態生成模型H3,支援2K解析度與原生雙聲道,性能與Seedance 2.5同級,但每秒定價僅0.8元人民幣,並宣布數日內開放模型權重。H3透過自研VAE與全模態理解管線降低算力成本,能一次生成含配音、字幕與動效的成片,可能取代部分傳統後期工序。此舉打破視頻生成市場由閉源模型主導的局面,為中小團隊與重視數據主權的B端客戶提供新選擇。

阿里企業級 Agent 產品“千問辦公”開啟公測,集成最新旗艦模型 Qwen3.8
阿里巴巴企業級Agent產品「千問辦公」正式開啟公測,個人與企業用戶可透過官網體驗,並整合了QoderWork、MuleRun、悟空三款產品,成為業界首款同時支援桌面端、雲端與企業協同Agent的產品。該服務搭載最新旗艦模型Qwen3.8,並提供免費版、個人標準版、個人高級版及企業版等多種訂閱方案,其中個人標準版與高級版目前有8折優惠。