谷歌正在開發新款芯片,Gemini架構直接寫入硅片,效率最高提升10倍

重點摘要
谷歌开发新一代AI芯片Frozen v2 Gemini架构直接写入硅片 推理效率最高提升10倍 据科技媒体The Information报道,谷歌正在开发一款专为其Gemini AI模型量身定制的新型服务器芯片,代号“Frozen v2”。该芯片将Gemini模型的底层架构直接固化于硅片之中,旨在大幅提升AI推理效率。知情人士透露,其单位功耗可处理的token数量有望达到现有自研芯片的6至10倍,最早或于2028年投入部署。受此消息提振,谷歌股价本周一盘初一度上涨3.7%。
谷歌开发新一代AI芯片Frozen v2 Gemini架构直接写入硅片 推理效率最高提升10倍
据科技媒体The Information报道,谷歌正在开发一款专为其Gemini AI模型量身定制的新型服务器芯片,代号“Frozen v2”。该芯片将Gemini模型的底层架构直接固化于硅片之中,旨在大幅提升AI推理效率。知情人士透露,其单位功耗可处理的token数量有望达到现有自研芯片的6至10倍,最早或于2028年投入部署。受此消息提振,谷歌股价本周一盘初一度上涨3.7%。这一项目的直接驱动力来自谷歌内部日益严峻的AI算力短缺问题。两位直接知情人士向The Information表示,算力瓶颈已引发内部资源矛盾,甚至迫使谷歌云拒绝部分外部客户的合作请求。
Frozen v2通过将部分Gemini模型的决策逻辑预先嵌入芯片,减少运行时所需的计算步骤与数据搬运量,从而在提升响应速度的同时降低单位算力功耗。Frozen v2的核心设计理念在于将Gemini模型的底层架构“永久刻入”芯片硅基,使其在处理推理请求时无需像通用芯片那样进行大量实时决策。报道指出,以每单位功耗可处理的token数量衡量,该芯片的效率预计达到谷歌现有最新一代自研AI芯片(TPU)的6至10倍。这一对比鲜明的逻辑背后,是谷歌现有张量处理器(TPU)与英伟达GPU类似的通用架构——它们需兼容多种AI模型,运行特定模型时必须处理大量动态决策过程。
Frozen v2通过预先固化部分决策换取更高运行效率,但代价是通用性的明显降低。在固化程度的选择上,谷歌正评估应将多少信息锁定于芯片之中,以求在灵活性与效率之间取得平衡。知情人士表示,Frozen v2仅能兼容与设计时所采用相同底层架构的Gemini后续版本,但芯片支持模型权重的更新——即决定模型如何响应问题的参数设置可根据版本演变而调整。这意味着谷歌实际上是在押注自身将长期沿用当前的Gemini模型架构,但保留了参数层面的迭代空间。项目前身是谷歌DeepMind首席科学家Jeff Dean主导的“原版Frozen”方案。
该方案一度计划将模型权重本身直接烧录进芯片,但由于芯片仅能服务于某一特定版本Gemini,生命周期过短,该方案已被搁置。Frozen v2在此基础上做出关键调整,转向“弹性固化”思路——固化模型架构而非具体权重,从而在保留大部分效率优势的同时延长芯片使用周期。从行业参照来看,加拿大芯片初创公司Taalas采用了类似的将特定AI模型硬编码入芯片的设计理念,目前已从Quiet Capital、富达等投资方融资超过2亿美元。而SambaNova、d-Matrix以及OpenAI、微软等公司也在开发各自面向推理的芯片,但技术路径与谷歌有所不同。
英伟达则在去年12月斥资200亿美元与推理芯片初创公司Groq达成技术授权协议,以强化自身在推理市场的布局。谷歌明确将Frozen v2定位为TPU产品线之外的新分支,而非对其现有人工智能芯片体系的替代。TPU与英伟达GPU同属通用AI芯片,可兼容多种模型;Frozen v2则专为Gemini打造,两条产品线将并行发展。谷歌目前尚无将Frozen v2大规模扩产至与TPU相当体量的计划。知情人士指出,相对有限的部署规模使得谷歌可以在项目后期再引入外部设计与制造合作伙伴,无需像重大产品发布那样提前大规模统筹。
此外,谷歌也在一定程度上将这一代产品视为工程试验——为工程师积累开发更高专用化芯片的经验,尤其是在AI模型架构逐渐趋于稳定的背景下。谷歌现有的自研芯片战略已初见成效。今年,谷歌发布了第八代TPU(TPU v8),并开始将其直接向云计算客户销售,向英伟达的主导地位发起挑战。据悉,谷歌已与Meta签署了价值数十亿美元的TPU租用协议,并正积极争取其他云服务提供商客户。自主研发芯片已经帮助谷歌以更低成本运行Gemini模型;Frozen v2若成功,则有望进一步放大这一成本优势。
谷歌发言人在一份声明中表示,公司团队“持续研究和探索新创新,以为用户和客户提供最高性能与效率”,并补充称“并非每个项目都会进入量产,但这种严格的探索是我们全栈方法的核心”。综合来看,Frozen v2代表了谷歌在AI推理芯片领域的一次大胆架构押注——通过牺牲部分通用性换取极致效率,将模型架构直接写入硅片。随着AI模型架构逐步收敛,类似的专用化芯片设计思路可能在行业内获得更广泛采用。而谷歌若能在2028年前后成功部署这款芯片,将有望在控制运营成本的同时巩固其在生成式AI领域的竞争优势。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。