何夕2077生成式AI

谷歌發佈八代TPU雙芯

2026年8月3日 00:00

重點摘要

Google 今日正式發表第八代 TPU 晶片,並首次針對不同工作負載推出兩款專用系統:TPU 8t 與 TPU 8i。這兩款晶片是 Google Cloud AI 超級電腦(AI Hypercomputer)的核心元件,分別針對大規模預訓練與即時推理服務進行最佳化,以因應從密集式大型語言模型(LLM)到混合專家模型(MoE)、乃至於具備長序列推理能力的 agentic AI 與世界模型的運算需求。 Google 在設計 TPU 時始終圍繞三大支柱:可擴展性、可靠性與效率。

站內 AI 整理稿

Google 今日正式發表第八代 TPU 晶片,並首次針對不同工作負載推出兩款專用系統:TPU 8t 與 TPU 8i。這兩款晶片是 Google Cloud AI 超級電腦(AI Hypercomputer)的核心元件,分別針對大規模預訓練與即時推理服務進行最佳化,以因應從密集式大型語言模型(LLM)到混合專家模型(MoE)、乃至於具備長序列推理能力的 agentic AI 與世界模型的運算需求。Google 在設計 TPU 時始終圍繞三大支柱:可擴展性、可靠性與效率。

隨著 AI 模型從單純預測下一個 token 的架構,演進為能模擬未來情境、推論後果並透過「想像」學習的世界模型,硬體不能只增加浮點運算次數,必須針對不同階段的運算密集型任務提供專屬路徑。第八代 TPU 正是為此而生,確保從訓練的第一個 token 到多輪推理鏈的最後一步,都能在最高效率的路徑上執行。Google DeepMind 的 Genie 3 世界模型即仰賴此架構,讓數百萬個 agent 能在多樣化的模擬環境中練習並精進推理能力。為因應預訓練、後訓練與即時推理在基礎設施需求上的明顯分歧,Google 將第八代 TPU 拆分為兩個獨立系統。

兩者共享 Google AI 堆疊的核心基因,並均整合 Arm 架構的 Axion CPU 作為主機端,以消除資料準備延遲造成的瓶頸,確保 TPU 不會因等待資料而停滯。**TPU 8t:預訓練效能怪獸**

TPU 8t 專為大規模預訓練與大量嵌入(embedding)工作負載所設計,沿用 Google 成熟的 3D Torus 網路拓樸,並將單一 Superpod 內的晶片數量擴展至 9,600 顆。其關鍵革新包括:內建 SparseCore 專用加速器,專門處理嵌入查詢中不規則的記憶體存取模式,避免一般通用晶片常見的零運算瓶頸;同時透過更平衡的向量處理單元(VPU)與矩陣乘法單元(MXU)重疊執行,讓量化、softmax 與層歸一化等作業能與矩陣乘法並行,最大化晶片使用率。

TPU 8t 更導入原生 4 位元浮點格式(FP4),在維持大型模型準確度的前提下,將 MXU 吞吐量提升一倍,同時降低記憶體頻寬壓力與資料搬運的能耗,使更大規模的模型層能完整放入晶片內建緩衝區。在網路方面,Google 為 TPU 8t 全新打造 Virgo 網路架構,採用高埠數交換器與扁平化雙層非阻塞拓樸,將資料中心網路(DCN)頻寬提升至前一代的 4 倍,並將晶片間互連(ICI)頻寬提升 2 倍。Virgo 網路可連結超過 13.4 萬顆 TPU 8t 晶片,在單一 Fabric 中提供高達 47 Pb/s 的非阻塞雙向頻寬,並實現超過 1.

7K ExaFlops 的效能,且為近線性擴展。此外,TPU 8t 引入 TPUDirect RDMA 與 TPUDirect Storage 技術。前者允許 TPU 的高頻寬記憶體(HBM)直接與網路介面卡(NIC)交換資料,繞過主機 CPU 與 DRAM;後者則讓 TPU 直接存取高速託管儲存(如 10T Lustre),使訓練資料能以線速直接送入晶片,避免資料攝取瓶頸。與第七代 Ironwood TPU 相比,儲存存取速度提升達 10 倍。**TPU 8i:推理與服務專家**

TPU 8i 則針對後訓練與高並發推理最佳化,配備 Google 歷來最大量的晶片內 SRAM(384 MB,為前一代 3 倍),可將更大的 KV 快取完全放在晶片上,顯著降低長序列解碼時的核心閒置時間。其核心創新是全新的 Collectives Acceleration Engine(CAE),專門加速自回歸解碼與思維鏈(chain-of-thought)處理中的歸約與同步步驟,將晶片內集體通訊的延遲再降低 5 倍。TPU 8i 採用全新的 Boardfly 網路拓樸,取代傳統的 3D Torus。

Boardfly 基於高埠數設計,將晶片以全連接板卡形式組成群組,再透過光學電路交換器(OCS)聚合為 Pod,最多可連結 1,152 顆晶片,並將最大網路直徑從 3D Torus 的 16 跳(以 1,024 晶片規模計算)大幅縮減至僅 7 跳,降幅達 56%。這對於混合專家模型與推理模型中頻繁發生的全對全通訊(all-to-all)而言,能直接降低尾延遲,讓 CAE 無需等待資料橫跨整個 Pod 送達。**軟體與擴展性**

硬體效能離不開軟體驅動。第八代 TPU 延續從第七代 Ironwood 開始的效能優先軟體堆疊,提供 Pallas 自訂內核語言與 Mosaic 框架,讓開發者能撰寫硬體感知的內核,同時保有高階框架的抽象便利性。Google 並透過 JAX 與 Pathways 分散式訓練框架,可將單一訓練叢集擴展至超過 100 萬顆 TPU 晶片,實現近乎線性的效能擴展。 **規格一覽**

- **TPU 8t**:主要工作負載為大規模預訓練;網路拓樸為 3D Torus;專用晶片功能為 SparseCore(嵌入)與 LLM 解碼引擎;HBM 容量 216 GB;晶片內 SRAM 128 MB;峰值 FP4 效能 12.6 PFLOPs;HBM 頻寬 6,528 GB/s;主機端採用 Arm Axion CPU。- **TPU 8i**:主要工作負載為取樣、服務與推理;網路拓樸為 Boardfly;專用晶片功能為 CAE(Collectives Acceleration Engine);HBM 容量 288 GB;晶片內 SRAM 384 MB;峰值 FP4 效能 10.

1 PFLOPs;HBM 頻寬 8,601 GB/s(約為 TPU 8t 的 1.3 倍);主機端同樣採用 Arm Axion CPU。第八代 TPU 的推出,標誌著 Google 在 AI 基礎設施上從通用加速走向任務專門化的關鍵一步,也為訓練與部署下一代世界模型、agentic AI 系統提供了更高效、可擴展的運算平台。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

8 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前