谷歌被曝要把Gemini“寫進”芯片?推理能效最高提升10倍
重點摘要
谷歌正在研發一款名為Frozen v2的新型AI服務器芯片,計劃將Gemini模型部分架構直接整合到晶片中,藉此減少運算決策與資料搬運,預估能效可達現有自研AI晶片的6至10倍。該晶片最快有望於2028年部署,目前仍在決定鎖定多少模型資訊以平衡效率與靈活性,且並非取代TPU,而是谷歌的技術試驗。
谷歌正在研發一款專門為其Gemini模型打造的新型AI服務器晶片,內部代號為「Frozen v2」。根據知情人士透露,這款晶片的設計理念是將Gemini模型的部分架構直接整合進硬體中,藉此減少運算過程中的決策步驟與資料搬運,進而大幅提升AI推理效率。谷歌工程師初步評估,若以單位功耗所能輸出的Token數量來計算,Frozen v2的效能可能達到谷歌目前最新自研AI晶片的六到十倍。 這項計畫的背後,反映出谷歌內部正面臨嚴重的AI算力短缺問題。知情人士指出,算力緊張不僅在內部引發部門之間的矛盾,甚至迫使谷歌雲端服務不得不拒絕部分外部客戶的訂單。為了緩解這項壓力,谷歌決定從晶片設計層面尋求突破,而Frozen v2正是承載這項期望的關鍵專案。據稱,谷歌最快可能於2028年部署這款晶片,不過目前仍在敲定主要功能、各模組的協作方式,以及究竟要將多少模型資訊固化在晶片之中。 與當前主流AI晶片強調通用性與可編程能力的做法不同,Frozen v2走的是專用化路線。傳統GPU如輝達的產品,能夠支援多種AI模型與運算任務,因此在執行過程中需要根據模型需求進行大量排程與決策;谷歌自研的TPU雖然已針對AI進行最佳化,但仍需兼顧不同模型的運作需求。Frozen v2則試圖讓硬體在製造階段就「預先了解」Gemini模型的運作邏輯,從而減少晶片在執行推理任務時的動態決策,並降低晶片內部的資料移動量。簡單來說,傳統GPU就像一台能執行各種軟體的通用電腦,而Frozen v2更像是專為Gemini最佳化的專用硬體,理論上能帶來更快的回應速度,並顯著降低Gemini模型的運作成本。 然而,專用化也意味著更強的綁定。一旦未來Gemini模型採用全新的底層架構,Frozen v2可能無法直接相容,因此谷歌必須在晶片效率與模型靈活性之間仔細權衡。知情人士透露,谷歌目前仍在評估Frozen v2中應該固定多少模型資訊,以兼顧效能提升與未來升級的彈性。谷歌發言人則在聲明中表示,研究團隊持續探索新技術以提升系統效能,並非所有研究專案都會投入量產,但這些嘗試是谷歌全棧技術路線的重要一環。 值得留意的是,Frozen v2並非谷歌首次嘗試開發模型專用晶片。早在更早階段,谷歌DeepMind首席科學家傑夫·迪恩曾主導一項更激進的初代Frozen方案,計畫直接將模型權重固化到晶片中。但這種設計會讓晶片只能運行特定版本的Gemini,一旦模型更新,晶片便可能迅速失去使用價值。由於預期生命週期過短,谷歌最終擱置了初代方案。Frozen v2則不再固化完整模型權重,但仍在評估要鎖定多少資訊,以平衡靈活性與效率。 在AI推理晶片領域,競爭正持續升溫。過去幾年,AI基礎設施的競爭主要圍繞模型訓練展開,大規模訓練需要大量GPU叢集,輝達憑藉其生態系統佔據主導地位。但如今,多家公司正將目光轉向推理晶片,目標是以比輝達GPU更高的效率運行AI模型,緩解算力短缺並降低成本。據報導,輝達去年底透過一筆價值約200億美元的交易,取得了AI推理晶片新創Groq的相關技術授權;此外,SambaNova、d-Matrix、OpenAI與微軟等公司也都投入研發。加拿大晶片新創Taalas甚至採取了與谷歌類似的思路,將特定AI模型直接硬編碼進晶片,該公司已獲得超過2億美元的融資。 回到谷歌,Frozen v2雖然受到關注,但知情人士強調,這款晶片並非用來取代TPU。谷歌今年已發表第八代TPU,並開始直接向雲端客戶推銷,試圖挑戰輝達在AI晶片市場的主導地位。谷歌也與Meta簽署了價值數十億美元的TPU租賃協議,並嘗試向其他雲端服務商銷售TPU。相較之下,Frozen v2的定位是建立一條有別於TPU的新型自研晶片路線,且谷歌目前沒有計畫讓它的產量達到TPU的規模。較小的生產規模可以讓谷歌在推出大型產品前,更晚地引入外部晶片設計與製造合作夥伴。知情人士還透露,谷歌將這一代產品部分視為技術試驗,希望從中累積開發專用AI晶片的經驗。 總體而言,Frozen v2的設計哲學是以部分通用性換取更高的推理效率。谷歌希望透過將部分模型架構與計算決策固化到硬體中,減少推理過程中的動態步驟與資料搬運,從而以更低的功耗處理更多用戶請求。不過,更高的專用化程度也意味著晶片與模型架構綁定得更緊。Frozen v2最快也要到2028年才能部署,屆時Gemini的底層架構能否保持穩定,以及六到十倍的預期能效提升能否在實際應用中實現,將成為決定這項專案價值的關鍵。
Related
相關文章

谷歌推出Gemini 3.6 Flash,3.5 Flash-LITE,以及3.5 Flash Cyber
谷歌AI突然“開火”:三款Gemini模型齊發,最高降價近七成,旗艦3.5 Pro仍難產 李丹 發表於 2026年07月21日 15:19 摘要:Gemini 3.6 Flash主打代碼、知識工作和多模態任務,在減少輸出Token消耗的同時,價格也低於上一代;Gemini 3.5 Flash-Lite瞄準高吞吐、低延遲場景;Gemini 3.

Google要把AI大模型「刻」進芯片裡
Google正推動將大型AI模型直接固化在晶片硬體層級,以減少對外部記憶體與頻寬的依賴。此技術若成真,可大幅降低推論階段的延遲與功耗,對大規模部署生成式AI服務極具戰略意義。

AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型
AI獨角獸Glean創辦人指出,目前超過九成企業AI應用場景不需使用最強模型,開源模型已能滿足多數需求。企業導入AI的真正瓶頸在於上下文工程,而非模型能力,模型商品化將使價值轉向應用層。應用公司應深入客戶核心工作流程,不必過度擔心模型廠商直接競爭。

WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”
在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

印奇的手機,階躍星辰的賭局
根據鈦媒體的報導,印奇的手機業務與階躍星辰的賭局成為近期科技圈的討論焦點。印奇作為曠視科技的創始人,其跨足手機領域的動作引發市場關注;而階躍星辰則被報導描述為在一場AI技術的賭局中下注。報導聚焦於兩者之間的戰略關聯與市場風險,但目前僅能從標題中窺見其核心方向,具體的產品細節、合作夥伴及定價策略等資訊尚未完整揭露。

在下一個模型發佈之前
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。