清華唐傑團隊揭示大模型記憶全景

重點摘要
清華大學唐傑團隊聯合新加坡國立大學與Bosch AI發表綜述,首次提出三維記憶分類學,系統性解析大語言模型的內部記憶機制。該研究聚焦於模型架構層面的記憶,而非外部Agent框架,並指出記憶機制正從Transformer的KV Cache轉向更高效的顯式記憶模塊。
清華唐傑團隊揭示大模型記憶全景量子位·2026年08月05日 15:35LLM記憶架構全景圖,萬字長文解構大模型記憶機制 近年來,大語言模型(LLMs)的突破很大程度上歸功於Scaling Laws(參數、數據、算力)。然而,在模型演進的過程中,一個同等重要的維度正變得愈發關鍵——記憶(Memory)。從Transformer中伴隨計算產生的KV Cache,到線性RNN/SSM的隱式狀態壓縮,再到近期大火的Titans、TTT(Test-Time Training)以及Engram等顯式、可持久化記憶模塊,大模型的底層記憶機制正在經歷一場深刻的範式轉換。
基於此方向,清華大學唐傑教授團隊、新加坡國立大學(NUS)以及Bosch AI聯合發佈了一篇針對大模型記憶架構前沿的詳盡綜述。文章不僅首次提出了三維記憶分類學(Representation, Update Dynamics, Persistence),還將零散的前沿工作統一到了一個連貫的理論框架下,為下一代更高效、可長效學習的LLM設計指明瞭方向。
這裡需要特別澄清的是,本文探討的“記憶”特指模型架構層面的內部記憶(Architectural-level Memory)——即模型在網絡底層對歷史信息的表徵、壓縮與狀態更新;而非目前同樣火熱的、通過外部Agent框架(如外掛對話日誌、本地文件檢索引擎等)實現的Agent層面記憶。背景:大模型記憶的範式轉移 傳統意義上,LLM的內部“記憶”往往是隱式的、作為計算的副產品存在的。Transformer的自注意力機制提供了一個基於內容的瞬時工作記憶(KV Cache),但其計算與存儲開銷隨序列長度呈二次方增長,且嚴重依賴於上下文窗口的限制。近期的研究趨勢表明,僅僅“拉長”上下文窗口已經不夠了。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。