Google要把AI大模型「刻」進芯片裡

重點摘要
Google正推動將大型AI模型直接固化在晶片硬體層級,以減少對外部記憶體與頻寬的依賴。此技術若成真,可大幅降低推論階段的延遲與功耗,對大規模部署生成式AI服務極具戰略意義。
Google 正積極探索一條全新的技術路線,試圖將大型 AI 模型直接「刻」進晶片之中。根據業界傳出的消息,這項計畫的核心目標,是把預先訓練好的神經網路參數與架構,直接固化在硬體層級,從根本上減少模型在運算時對外部記憶體與頻寬的依賴。這項技術若能成功,將大幅改變當前 AI 晶片與雲端服務的運作模式。過去數年,Google 在自行研發的張量處理單元(TPU)上累積了深厚的經驗。TPU 專為機器學習工作負載設計,已經在 Google 的搜尋、廣告、翻譯以及雲端服務中扮演關鍵角色。如今,Google 下一步可能進一步整合模型邏輯,打造更專用、更高效的 AI 晶片。
不同於傳統的軟體加載模式,將模型「刻」進晶片意味著參數與運算單元一體成型,硬體能直接執行特定模型的前向傳播,無需反覆從記憶體讀取權重。這項技術路線的潛在優勢相當顯著。若成真,將能大幅降低大型語言模型在推論階段的延遲與功耗。對於需要大規模部署生成式 AI 服務的 Google 而言,這極具戰略意義。無論是雲端伺服器還是邊緣裝置,都能夠更即時地回應複雜指令,同時減少能源消耗與營運成本。目前,大型語言模型的運算瓶頸往往不在於運算本身,而在於記憶體頻寬。模型參數動輒數十億甚至上千億,每次推論都需要從記憶體中讀取大量權重,這不僅造成延遲,也導致功耗居高不下。
將模型固化在晶片中,相當於讓運算單元與參數緊密結合,省去頻繁的資料傳輸,從根本上解決這個問題。Google 並非第一次嘗試在硬體層面最佳化 AI 工作負載。早在 2016 年,該公司就推出第一代 TPU,專為神經網路推論設計。後續的 TPU 系列更加入訓練能力,並在 Google Cloud 上提供服務。此外,Google 也開發了 Edge TPU,專為邊緣運算場景設計,讓裝置能在本地執行 AI 推論。如今,將模型「刻」進晶片的想法,可以視為這條路線的終極版本。不過,這項技術也面臨嚴峻挑戰。將模型固化在硬體中,意味著晶片只能執行特定模型的推論,無法靈活切換或更新。
一旦模型需要更新,就必須更換硬體。這對於快速迭代的 AI 領域來說,可能是一大限制。因此,Google 很可能會選擇將這項技術應用在參數相對穩定、部署規模極大的模型上,例如搜尋排名、語音辨識或核心的生成式 AI 服務。另一項挑戰在於製程與成本。將大規模神經網路參數直接整合進晶片,需要極高的晶片面積與先進製程技術,這將推高開發與生產成本。Google 是否能夠在效能與成本之間取得平衡,將決定這項技術能否規模化商用。儘管如此,業界普遍認為,Google 的這項嘗試具有深遠影響。
如果成功,它將打破現有 AI 晶片市場的格局,讓雲端服務商不再單純依賴通用 GPU 或 ASIC,而是擁有專為自家模型打造的硬體。這也將進一步強化 Google 在 AI 領域的競爭優勢,尤其是在生成式 AI 浪潮下,各家科技巨頭都在爭奪運算效率與成本控制的主導權。從更宏觀的角度看,將 AI 模型「刻」進晶片,代表著軟硬體一體化設計的趨勢正在加速。過去,AI 模型的部署主要依賴通用運算平台,軟體與硬體之間存在明顯的界線。如今,Google 試圖將這條界線模糊化,讓模型本身成為硬體的一部分。這不僅能提升效能,也可能催生全新的晶片設計方法論。
對於開發者與企業用戶而言,這項技術若落地,將意味著更低的推論成本與更快的回應速度。Google 的雲端服務可能因此推出更高效能的 AI 推論方案,讓企業能夠以更低的價格使用大型語言模型。同時,邊緣裝置如 Pixel 手機、智慧音箱或物聯網設備,也能在本地執行更複雜的 AI 任務,無需頻繁連線雲端。目前,Google 尚未正式公開這項技術的具體時間表或產品規格。但從該公司在 TPU 與深度學習領域的長期投資來看,這項方向幾乎可以確定是 Google 內部的重點研發項目。業界預期,未來幾年內,我們很可能會看到 Google 發表搭載「模型固化」技術的下一代 AI 晶片。
總而言之,Google 正試圖透過將大型 AI 模型直接嵌入晶片,從根本上改變 AI 運算的效率與模式。這項技術雖然面臨製程、成本與靈活性的挑戰,但若能成功,將為生成式 AI 的規模化部署帶來革命性突破。對於整個科技產業而言,這不僅是一項晶片設計的創新,更可能重新定義 AI 時代的硬體架構。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。