把記憶交給CPU,大模型會變快

在數據中心的日常運作中,Coding Agent 正承擔著越來越複雜的程式開發與除錯任務。當一個 Agent 被指派處理橫跨十幾個檔案的程式錯誤時,它必須反覆讀取不同檔案中的程式碼、查詢相關資料庫,並執行多輪測試來驗證修復結果。前幾輪的互動通常還能保持流暢,但隨著任務持續推進,系統需要管理的歷史資訊會不斷累積——包括已讀取過的檔案片段、測試結果、修改記錄,甚至與開發者的對話上下文。這些資訊加總起來,形成一個龐大的長期記憶體,而如何有效率地存取與管理這些記憶,成為影響回應速度的關鍵。
當成千上萬個這類 Agent 同時在數據中心內進行類似工作時,營運端就會面臨一個棘手的狀況:伺服器雖然仍在運轉,能夠承接的併發請求卻逐漸緊繃,部分請求甚至連產出第一個 Token 都得等待很長的時間。這種延遲不僅影響使用者體驗,更可能拖累整個 CI/CD 流程,導致開發團隊的生產力大幅下滑。從系統層面來看,這種效能瓶頸的根源,在於大模型在長期任務中必須保留大量上下文記憶,而這些記憶的存取與管理方式,決定了回應速度能否維持穩定。傳統做法往往依賴記憶體或外部儲存來暫存歷史資料。
例如,常見的解決方案是將對話歷史、檔案內容與中介結果寫入 GPU 的顯存或 CPU 的系統記憶體,甚至使用 NVMe SSD 作為快取層。然而,隨著對話輪次與檔案數量增加,這些儲存媒體的讀寫延遲就會逐漸累積,進而拖累整體吞吐量。特別是當 Agent 需要跨檔案查詢資訊時,每次讀取都可能觸發多次 I/O 操作,而記憶體與運算核心之間的資料傳輸路徑越長,等待時間就越可觀。這就好比一個忙碌的圖書館員,如果每次查閱書籍都要從遙遠的倉庫調閱,那麼回應讀者的速度自然會隨著委託數量增加而大幅下降。為了突破這個障礙,研究人員開始探索將記憶處理流程更貼近運算核心的可能性。
其中一個備受關注的方向,是將上下文記憶的管理工作交由 CPU 來負責。乍聽之下,這似乎違反直覺——畢竟 GPU 才是大模型運算的主力。但深入檢視會發現,CPU 在處理記憶體存取與任務排程方面具有獨特的優勢。CPU 不僅擁有更豐富的快取階層(L1、L2、L3),還能透過指令管線與分支預測機制,更有效率地處理記憶體位址的隨機存取模式。當大模型需要頻繁查詢歷史資訊時,CPU 可以扮演一個「智慧管家」的角色,預先將常用的記憶片段載入到高速快取中,並在 GPU 需要時以極低延遲傳遞過去。這種架構的關鍵在於縮短資料傳輸路徑。
傳統上,GPU 進行推理時,若要存取儲存在系統記憶體中的上下文資料,必須透過 PCIe 通道來回傳輸,這條路徑的延遲往往以微秒甚至毫秒計,對於追求低延遲的推理服務來說是不小的負擔。若將記憶管理交給 CPU,CPU 可以將熱門的上下文資料存放在 L3 快取中,當 GPU 發出請求時,CPU 能以納秒等級的速度提供資料,大幅減少等待時間。更重要的是,CPU 可以同時處理多個 Agent 的記憶排程,避免大量請求同時湧向同一條 PCIe 通道而產生堵塞。當然,這個方案並非沒有挑戰。CPU 快取的容量畢竟有限,而大模型的上下文長度可能達到數萬甚至數十萬個 Token。
如何在有限的快取空間內動態管理哪些記憶應該保留、哪些可以釋放或降級至較慢的儲存層,需要精巧的演算法與硬體協作。此外,CPU 與 GPU 之間的通訊協定也需要最佳化,以確保記憶體一致性和同步效率。不過,隨著 CPU 架構持續演進(例如 Intel 的 Advanced Matrix Extensions 與 AMD 的 3D V-Cache 技術),CPU 在記憶體密集任務中的角色正變得越來越重要。目前已有幾家大型雲端服務商與晶片設計公司開始在內部測試這類混合架構。
初步結果顯示,在處理需要長時間上下文記憶的 Coding Agent 場景時,將記憶管理從 GPU 轉移至 CPU 可以將首個 Token 的延遲降低 30% 至 50%,同時整體吞吐量提升約 20%。這些數字雖然尚未大規模公開驗證,但已經引起學術界與工業界的廣泛興趣。業界人士認為,這套方法特別適合那些需要長時間對話、跨檔案分析、或是多輪工具呼叫的應用場景,例如程式碼生成助手、客戶服務機器人,以及自動化數據分析平台。值得注意的是,這項技術的發展也與大模型本身的進化息息相關。
當模型能夠處理更長的上下文(例如 Google Gemini 的 1M Token 或 OpenAI 的 128K Token),系統對記憶管理的需求只會更加迫切。如果 CPU 能夠有效接管記憶調度工作,那麼未來大模型在數據中心中不僅能保持高效回應,還有可能支援更複雜的任務鏈,例如讓 Agent 在數小時的任務過程中持續累積經驗,而不會因為記憶體瓶頸而被迫中斷。從長期來看,將記憶交給 CPU 可能只是第一步。研究人員也在探索專用記憶體控制器、近記憶體運算(Near-Memory Computing)以及光學互連等新技術,試圖從根本上消弭運算與記憶之間的距離鴻溝。
然而,在這些前瞻技術成熟之前,利用現有 CPU 的智慧快取管理能力來緩解大模型記憶瓶頸,無疑是一條務實且具備可擴展性的路徑。對於那些正在為 Coding Agent 部署苦惱的營運團隊而言,這或許是改善效能最直接的切入點——無須更換昂貴的 GPU,只需調整軟體架構與利用既有 CPU 資源,就能讓上百萬個 Agent 同時流暢地工作,真正實現「把記憶交給 CPU,大模型會變快」的承諾。
Related
相關文章

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人
作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

具身智能技術路線尚未定型,基礎設施卻先收斂
具身智能技術路線尚未成形,但基礎設施需求已開始收斂,重點從製造機器人轉向持續迭代機器人能力。百度集團沈抖指出,智能體能力邊界快速擴展,進入規模化部署階段,但機器人學習新任務與跨環境適應性仍待突破。

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”
AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。
Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽
作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題
吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢
作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。