Google要把AI大模型「刻」進芯片裡

重點摘要
Google正推動將大型AI模型直接固化在晶片硬體層級,以減少對外部記憶體與頻寬的依賴。此技術若成真,可大幅降低推論階段的延遲與功耗,對大規模部署生成式AI服務極具戰略意義。
Google 正積極探索一條全新的技術路線,試圖將大型 AI 模型直接「刻」進晶片之中。根據業界傳出的消息,這項計畫的核心目標,是把預先訓練好的神經網路參數與架構,直接固化在硬體層級,從根本上減少模型在運算時對外部記憶體與頻寬的依賴。這項技術若能成功,將大幅改變當前 AI 晶片與雲端服務的運作模式。 過去數年,Google 在自行研發的張量處理單元(TPU)上累積了深厚的經驗。TPU 專為機器學習工作負載設計,已經在 Google 的搜尋、廣告、翻譯以及雲端服務中扮演關鍵角色。如今,Google 下一步可能進一步整合模型邏輯,打造更專用、更高效的 AI 晶片。不同於傳統的軟體加載模式,將模型「刻」進晶片意味著參數與運算單元一體成型,硬體能直接執行特定模型的前向傳播,無需反覆從記憶體讀取權重。 這項技術路線的潛在優勢相當顯著。若成真,將能大幅降低大型語言模型在推論階段的延遲與功耗。對於需要大規模部署生成式 AI 服務的 Google 而言,這極具戰略意義。無論是雲端伺服器還是邊緣裝置,都能夠更即時地回應複雜指令,同時減少能源消耗與營運成本。 目前,大型語言模型的運算瓶頸往往不在於運算本身,而在於記憶體頻寬。模型參數動輒數十億甚至上千億,每次推論都需要從記憶體中讀取大量權重,這不僅造成延遲,也導致功耗居高不下。將模型固化在晶片中,相當於讓運算單元與參數緊密結合,省去頻繁的資料傳輸,從根本上解決這個問題。 Google 並非第一次嘗試在硬體層面最佳化 AI 工作負載。早在 2016 年,該公司就推出第一代 TPU,專為神經網路推論設計。後續的 TPU 系列更加入訓練能力,並在 Google Cloud 上提供服務。此外,Google 也開發了 Edge TPU,專為邊緣運算場景設計,讓裝置能在本地執行 AI 推論。如今,將模型「刻」進晶片的想法,可以視為這條路線的終極版本。 不過,這項技術也面臨嚴峻挑戰。將模型固化在硬體中,意味著晶片只能執行特定模型的推論,無法靈活切換或更新。一旦模型需要更新,就必須更換硬體。這對於快速迭代的 AI 領域來說,可能是一大限制。因此,Google 很可能會選擇將這項技術應用在參數相對穩定、部署規模極大的模型上,例如搜尋排名、語音辨識或核心的生成式 AI 服務。 另一項挑戰在於製程與成本。將大規模神經網路參數直接整合進晶片,需要極高的晶片面積與先進製程技術,這將推高開發與生產成本。Google 是否能夠在效能與成本之間取得平衡,將決定這項技術能否規模化商用。 儘管如此,業界普遍認為,Google 的這項嘗試具有深遠影響。如果成功,它將打破現有 AI 晶片市場的格局,讓雲端服務商不再單純依賴通用 GPU 或 ASIC,而是擁有專為自家模型打造的硬體。這也將進一步強化 Google 在 AI 領域的競爭優勢,尤其是在生成式 AI 浪潮下,各家科技巨頭都在爭奪運算效率與成本控制的主導權。 從更宏觀的角度看,將 AI 模型「刻」進晶片,代表著軟硬體一體化設計的趨勢正在加速。過去,AI 模型的部署主要依賴通用運算平台,軟體與硬體之間存在明顯的界線。如今,Google 試圖將這條界線模糊化,讓模型本身成為硬體的一部分。這不僅能提升效能,也可能催生全新的晶片設計方法論。 對於開發者與企業用戶而言,這項技術若落地,將意味著更低的推論成本與更快的回應速度。Google 的雲端服務可能因此推出更高效能的 AI 推論方案,讓企業能夠以更低的價格使用大型語言模型。同時,邊緣裝置如 Pixel 手機、智慧音箱或物聯網設備,也能在本地執行更複雜的 AI 任務,無需頻繁連線雲端。 目前,Google 尚未正式公開這項技術的具體時間表或產品規格。但從該公司在 TPU 與深度學習領域的長期投資來看,這項方向幾乎可以確定是 Google 內部的重點研發項目。業界預期,未來幾年內,我們很可能會看到 Google 發表搭載「模型固化」技術的下一代 AI 晶片。 總而言之,Google 正試圖透過將大型 AI 模型直接嵌入晶片,從根本上改變 AI 運算的效率與模式。這項技術雖然面臨製程、成本與靈活性的挑戰,但若能成功,將為生成式 AI 的規模化部署帶來革命性突破。對於整個科技產業而言,這不僅是一項晶片設計的創新,更可能重新定義 AI 時代的硬體架構。
Related
相關文章

谷歌推出Gemini 3.6 Flash,3.5 Flash-LITE,以及3.5 Flash Cyber
谷歌AI突然“開火”:三款Gemini模型齊發,最高降價近七成,旗艦3.5 Pro仍難產 李丹 發表於 2026年07月21日 15:19 摘要:Gemini 3.6 Flash主打代碼、知識工作和多模態任務,在減少輸出Token消耗的同時,價格也低於上一代;Gemini 3.5 Flash-Lite瞄準高吞吐、低延遲場景;Gemini 3.

AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型
AI獨角獸Glean創辦人指出,目前超過九成企業AI應用場景不需使用最強模型,開源模型已能滿足多數需求。企業導入AI的真正瓶頸在於上下文工程,而非模型能力,模型商品化將使價值轉向應用層。應用公司應深入客戶核心工作流程,不必過度擔心模型廠商直接競爭。

WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”
在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

印奇的手機,階躍星辰的賭局
根據鈦媒體的報導,印奇的手機業務與階躍星辰的賭局成為近期科技圈的討論焦點。印奇作為曠視科技的創始人,其跨足手機領域的動作引發市場關注;而階躍星辰則被報導描述為在一場AI技術的賭局中下注。報導聚焦於兩者之間的戰略關聯與市場風險,但目前僅能從標題中窺見其核心方向,具體的產品細節、合作夥伴及定價策略等資訊尚未完整揭露。

在下一個模型發佈之前
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

WAIC重磅成果|上海儀電智算牽頭成立“智算系統架構聯盟”併發布《超節點系統架構規範》
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.