谷歌密謀「焊死」Gemini,神秘芯片曝光,能效碾壓TPU十倍

重點摘要
谷歌正在研發代號「Frozen v2」的專用伺服器晶片,將Gemini模型的部分底層架構永久蝕刻進矽片,預估能效比最新一代TPU高出六到十倍。這款晶片犧牲靈活性以換取極致效率,最快2028年部署,但前提是Gemini後續版本不能大幅改變底層架構。此舉反映谷歌因算力嚴重短缺,被迫將模型與晶片深度綁定,是軟硬體合體的一場豪賭。
谷歌正在秘密研發一款代號「Frozen v2」的全新伺服器晶片,這款晶片的設計理念極為大膽:計畫將Gemini模型的底層架構,永久性地蝕刻在矽晶片上。這意味著,Gemini不再只是「跑」在晶片上,而是「長」在晶片裡。根據參與該項目的谷歌員工預估,這款晶片每瓦特能處理的Token數量,將比谷歌最新一代的TPU高效6到10倍,最快有望在2028年部署上線。消息一出,Alphabet股價立即應聲上漲3.7%,一掃此前的低迷走勢。「Frozen」這個名字本身就說明了計畫的本質:將模型「凍結」進矽晶片。這是一個極度激進的作法。
目前主流的AI晶片,無論是NVIDIA的GPU還是谷歌自家的TPU,本質上都是通用晶片,能夠執行各種不同的模型。這種靈活性帶來的代價是,晶片在運行時需要進行大量即時決策,不斷搬運數據,反覆查詢運算路徑與方法。這就像一個什麼菜都能做的廚房,每做一道菜都得翻閱食譜、尋找工具、調整火候,效率自然大打折扣。而「Frozen v2」只為Gemini一個模型服務。它將Gemini的關鍵決策路徑直接內建在電路中,晶片不再需要「思考」該如何運作,因為路徑已經被直接澆鑄在矽晶片裡。這意味著更少的運算步驟、更少的數據搬運、更少的即時決策。
這就像為一道特定菜餚專門打造了一個灶台,爐眼大小、鍋具位置、火力檔位全部量身訂做,省下的每一步冗餘,都轉化為實實在在的能效提升。事實上,這個想法並非憑空出現。最初的「Frozen」晶片計畫,由Google DeepMind首席科學家Jeff Dean主導,當時的構想更為極端:直接將模型的權重(也就是決定模型如何回答問題的核心參數)燒錄進晶片。然而,這個方案最終被擱置,因為一旦權重被固化,晶片就只能服務於某個特定版本的Gemini,模型一更新,晶片就等同於報廢,生命週期極短。「Frozen v2」則是一個折衷方案:不固化權重,只固化底層架構。晶片的計算藍圖被刻死,但權重仍可更新。
這意味著,只要Gemini的底層架構沒有大幅變動,這款晶片就能持續使用,新版本的參數依然可以灌入。不過,谷歌內部仍在權衡,究竟要將多少東西鎖進矽晶片,鎖得越多,效率越高,但靈活性也越差,這正是整個計畫最關鍵的工程判斷。谷歌之所以願意下這步險棋,最直接的原因就是算力短缺。而且情況已經嚴重到不只是「有點緊張」,而是「送上門的錢都不賺了」。由於算力短缺,Google Cloud已經被迫開始拒絕外部客戶的訂單,這在商業公司中幾乎是最極端的信號。今年6月,谷歌簽下一紙驚人合約:每月向SpaceX支付9.2億美元,租用11萬張NVIDIA GPU的算力,合約一直簽到2029年。
一家全球最大的雲端運算公司,竟然要向一家火箭公司租借算力,這個畫面足以說明AI軍備競賽的瘋狂程度。谷歌並非孤軍奮戰。整個AI行業都在推理專用晶片上瘋狂押注。新創公司如SambaNova、d-Matrix正在積極投入,OpenAI、微軟也各自有相關計畫,亞馬遜有Trainium和Inferentia,微軟則有Maia。連NVIDIA自己都坐不住了,去年12月豪擲200億美元,取得了推理晶片公司Groq的技術授權。所有人的目標都只有一個:在每一瓦電力中,榨出更多的Token。
而將模型直接硬連接進晶片這條路,此前只有加拿大新創公司Taalas在走,它已從Quiet Capital、富達等投資方融資超過2億美元。然而,這十倍能效的背後,代價是「僵化」。只有當後續世代的Gemini,仍然沿用晶片設計時所使用的同一套底層架構時,「Frozen v2」才能持續工作。換句話說,谷歌正在進行一場豪賭,賭自己未來幾年不需要大幅改動Gemini的建構方式。從純Transformer到MoE混合專家模型,從純文字到多模態原生,從密集推理到稀疏激活,模型架構的迭代速度堪比手機行業最瘋狂的年代。
谷歌自己也清楚這個風險,因此「Frozen v2」的產量規模不會像TPU那麼大,更像是一次有限度的試驗。賭對了,就是一台印鈔機,每瓦電力多榨出好幾倍的Token,數據中心省下來的電費和機櫃空間都是純利潤;賭錯了,就當繳學費,教會工程師如何打造更專用的晶片,為下一代產品累積經驗。值得玩味的是,這個計畫披露的時機點。就在上週,彭博社才爆料,Gemini 3.5 Pro因為程式能力等多項指標不達標,已經三度延期。在模型端的發展腹背受敵之際,谷歌卻將更多籌碼推向了它最深的一條護城河——晶片。
從當年自研TPU以減少對NVIDIA的依賴,到今天將模型直接焊死在矽晶片裡,谷歌正走在同一條路的更深處:軟硬體協同的盡頭,就是軟硬體合體。AI的競爭,已經開始比拼物理層面的實力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。