AI不再用完即忘:華為諾亞開源MindMemOS,記憶和Skill一起進化

重點摘要
華為諾亞方舟實驗室開源MindMemOS,這是一個面向AI Agent的可遷移、自演進記憶操作層,將記憶從單一Agent中解耦,並以實體、屬性、時間三維結構保存最新狀態與演化軌跡。系統透過Dreaming離線鞏固記憶、Feedback挖掘用戶糾正性反饋,並支援Skill版本演進,在LoCoMo、PersonaMem等基準上取得領先成績,同時提升SpreadsheetBench任務成功率。
AI Agent的能力日益強大,但使用體驗卻始終存在一個尷尬的痛點:每更換一個Agent,甚至只是開啟一個新的對話session,就像換了一位對你一無所知的新員工。用戶的偏好、項目的背景脈絡,以及過去累積的經驗教訓,都無法隨之遷移,一切只能從頭解釋,彷彿將新Agent重新「養一遍」。這背後真正的挑戰,其實遠不止「有沒有記憶」這麼簡單,而是牽涉到記憶能否被攜帶、系統如何判斷該記住什麼,以及記憶與記憶系統本身能否持續進化。 為此,華為諾亞方舟實驗室近期開源了一款面向AI Agent的可遷移、自演進記憶操作層——MindMemOS。這套系統的核心思路,是將記憶從單一Agent中徹底解耦,不再讓記憶依附於某個特定的應用或框架。其記憶建模採用「實體、屬性、時間」的三維結構,不僅保存最新狀態,更完整記錄了事實的演化軌跡。透過MindSchema記憶模式,系統可以預設記憶提取規則,或圍繞特定任務與標註問答來離線演化提取策略;而Feedback機制則能挖掘用戶隱式的糾正性反饋,有選擇地強化或降級既有記憶,提升記憶的可靠性與一致性。此外,透過「Dreaming」機制,系統能在離線狀態下鞏固記憶、消解衝突,持續提升記憶品質。 MindMemOS首先改變了記憶的基本組織方式。傳統方案常將記憶保存為一組文本片段或向量塊,但MindMemOS採用三維結構來描述開放世界的信息流。其中,「實體」代表人、專案、文件、工具等持續存在的對象;「屬性」則記錄對象的事實、偏好與狀態;「時間」則標記屬性在何時成立、何時改變。這意味著系統不再將「用戶以前喜歡X」和「用戶現在改用Y」視為兩段互不相干的文本,而是將它們放回同一實體、同一屬性的時間軸上,讓實體之間建立語義關聯,並追蹤每個屬性的演變過程。 在此基礎上,MindMemOS提供了兩條互補的記憶生成路徑。第一條是MindVanilla模式,它不依賴預先定義的建模模板,可以接收對話、文本和工具執行軌跡,適合開放域信息快速進入統一記憶庫。第二條是MindSchema模式,系統會先透過實體建模規定當前領域關注的實體和屬性,再完成話題片段切分、屬性級記憶生成、等價實體融合和圖結構合併。不同場景可以調整記憶提取規則種子,讓同一套系統適配不同任務,而無需重寫整個記憶基礎設施。在檢索時,MindMemOS也並非只做一次向量相似度匹配,而是設計了一套「Compact Search」機制,由外層Agentic模組分析查詢、規劃檢索路徑,內層工具則執行從實體到屬性、從屬性反查實體、多跳關係擴展和屬性時間線追蹤等多路徑搜索,在記憶圖中尋找抵達答案最短且信息最充分的路徑。 人類不會永久保留每個細節,而是在回顧中合併重複信息、淘汰過時判斷,並從多次經歷中形成更抽象的認識。MindMemOS的「Dreaming」機制正是模擬了這個過程。它在離線階段從尚未整理的記憶出發,圍繞相關實體擴展局部範圍,識別重複、衝突和演化關係,再生成具體操作,例如合併冗餘內容、歸檔被新事實取代的舊記憶、補充關係,或發現更高階的模式。關鍵在於,這種整理結果會變成持久的記憶狀態,而不是把判斷壓力留給每一次回答時的語言模型。例如,當同一個實體對應兩條相互衝突的事實時,普通檢索可能將兩條內容一起返回,再期待回答模型臨場判斷;而MindMemOS會在Dreaming階段識別其中的替代關係,歸檔已經失效的版本,並保留「supersedes」關係,讓之後的普通檢索拿到更乾淨、沒有歧義的上下文。 在MemoryAgentBench的FactConsolidation子集測試中,Dreaming機制展現了「少即是多」的效果。它並非透過「記得更多」來換取提升,而是在提高單跳與多跳得分的同時,將大約五分之一的活躍記憶轉入歸檔,且歸檔的記憶不會被主動召回。這種減少干擾的方式,本身就是提升記憶品質的一部分。 除了系統主動整理,MindMemOS也讓用戶交互中的糾錯信號能回到記憶系統。用戶可以直接用自然語言指出某條記憶錯誤,也可以在後續對話中表達不滿、修正或新的偏好。系統會判斷這條信號是當前任務的臨時信息、特定場景偏好,還是適合長期保留的規律,再決定新增、更新、歸檔、刪除或強化相關記憶。這一步至關重要,因為用戶偏好往往不只是「是什麼」的事實,例如一個用戶說自己偏好臨時約見,真正影響推薦的可能是背後的原因——低壓力安排反而能讓其更可靠地赴約。隨著更多交互出現,系統會逐漸補全「為什麼」和「在什麼場景下成立」,而不是無限新增相似的碎片。 如果說事實和偏好讓Agent更懂用戶,那麼Skill則決定了它能否把經驗真正變成能力。MindMemOS將Skill視為記憶系統的關鍵應用,提供雲端Skill註冊、版本鏈、同步和回滾能力,並透過統一的Memory Add接口收集真實任務軌跡。當軌跡累積到一定數量後,系統會依序完成目標提取、關鍵轉折分析、工具使用與結果評估,並聚合反覆成功的策略與反覆出現的失敗,生成針對當前Skill文件的修改計劃,最終應用編輯並生成新的Skill版本。如果軌跡沒有任務得分,系統可以從反覆出現的成功路徑和失敗模式中做無監督演進;若有評分,則會強化高分軌跡中的有效行為,並抑制低分軌跡裡的常見錯誤。 在包含400個真實表格操作任務的SpreadsheetBench-Verified上,實驗結果顯示,未經優化的初始Skill甚至低於不使用Skill的表現。這說明給Agent一份操作指南並不必然帶來提升,過時、冗餘或不適配任務分佈的規則反而可能製造干擾。而MindMemOS的無監督演進僅依靠執行軌跡,就將成功率從51.3%提升到55.3%;加入任務評分後進一步達到57.2%,相比No-skill提升5.9個百分點,相比未經演進的Init-skill提升9.2個百分點。這背後的關鍵在於,系統從失敗軌跡中提煉出可執行的避錯規則,例如「不要把公式文本當作數值」、「篩選、排序和刪除時先從源表構造穩定快照」等,並在監督信號下學會規則的適用邊界。 除了上述機制,MindMemOS也在兩項主流長期記憶基準上評估了基礎記憶能力。在LoCoMo基準上,使用gpt-4.1-mini作為回答模型,MindMemOS-Modeling的Overall Accuracy達到94.03,成為所有對比方法中的最高結果。在面向長期個性化的PersonaMem上,MindMemOS-MindSchema的Overall Accuracy為70.63%,MindMemOS-MindVanilla也以67.74%略高於Baseline。這些結果共同指向一個結論:結構化建模的價值,不只是讓記憶「看起來更整齊」,而是讓系統在長期事實召回、用戶畫像和個性化推斷中獲得可測量的提升。 MindMemOS在架構上將Agent接入層、記憶算法層與記憶結構層解耦,當前開源代碼提供FastAPI HTTP接口、Python SDK、CLI、Skills以及OpenClaw插件等接入方式,覆蓋add、search、update、delete、feedback和dreaming等完整記憶生命週期操作。這種解耦帶來的直接價值是可遷移性:記憶不再綁定在某個Agent的私有實現中,而可以作為用戶、項目或組織獨立維護的長期資產,在不同應用和Agent框架之間複用。開發者既可以本地部署完整服務,也可以從雲端API、SDK或CLI開始接入。項目採用MIT License,詳細部署配置與評測流程均已隨代碼公開。 MindMemOS的應用場景也已延伸至自動算法設計領域。在LLM4AD_Next平台中,MindMemOS將算法搜索過程中產生的反饋轉化為可存儲、可檢索、可複用的經驗資產。針對算法設計任務層次多、週期長的特點,平台構建了任務記憶、項目記憶與全局記憶三層架構,並支持Auto Mode與Manual Mode兩種靈活的記憶調度機制。這使得每一次算法搜索都不再是孤立的嘗試,而是通往下一次「進化」的堅實起點。 當Agent擁有越來越強的模型與工具,長期智能的關鍵在於完成一百次任務之後,它留下了什麼。是越來越長、越來越混亂的歷史記錄,還是一套能追蹤變化、主動整理、接受糾正,並把成功與失敗持續沉澱為Skill的記憶系統?MindMemOS的答案是,將記憶從Agent的附屬緩存提升為獨立的操作層,讓信息可以跨場景建模,衝突可以在離線階段被消解,反饋可以反向修改記憶,任務軌跡則能持續推動Skill演進。從「記住用戶」到「學會做事」,這或許正是Agent從一次性工具走向長期協作者必須補上的一層基礎設施。
Related
相關文章

從TPU到自我進化的Agent,Jeff Dean如何判斷AI的下一步
這篇消息聚焦「從TPU到自我進化的Agent,Jeff Dean如何判斷AI的下一步」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
英偉達開源Molt框架
Home Uncategorized NVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning Framework Uncategorized Agentic reinforcement learning research is constant algorithm modification.
Jeff Dean研判智能體方向
Jeff Dean研判智能體方向。 Jeff Dean稱智能體將長期試錯。TPU經驗⚙️提示應先鎖定算力瓶頸。查看模型創業趨勢完整訪談提出尋找模型盲區。上下文工程正成為新護城河。產品品味將比基礎編碼更稀缺。
鵜鶘測試引爆AI爭論
鵜鶘測試引爆AI爭論。 Karpathy用Pelican���檢驗生成能力。社區在鵜鶘測試原帖熱議(AI資訊)裡質疑革命。Wave式協作���被重新想起。Agent與版權爭議仍在發酵。
k-skill深耕韓國本地語境
k-skill深耕韓國本地語境。 項目為智能體補齊韓國任務能力。技能庫收錄本地語境與實用工具。查看韓國智能體技能倉庫已獲**6886**。項目單日新增🌱177顆星。本地化智能體生態開始快速擴散。

Loop才火了六週,AI Coding為什麼又開始談Graph?
這篇消息聚焦「Loop才火了六週,AI Coding為什麼又開始談Graph?」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。