上海AI Lab團隊推出MemHarness:讓Agent記憶像人類一樣被重構

2026年8月3日 16:38
上海AI Lab團隊推出MemHarness:讓Agent記憶像人類一樣被重構

重點摘要

上海AI Lab團隊推出MemHarness框架,讓LLM Agent能像人類一樣動態重構記憶,而非直接套用靜態經驗。該方法在檢索與動作之間加入記憶重構環節,並透過GRPO端到端學習,顯著提升決策能力與分佈外場景的魯棒性。

站內 AI 整理稿

上海AI Lab團隊近日提出了一項名為MemHarness的全新框架,旨在讓大型語言模型(LLM)驅動的AI Agent(智能體)能夠像人類一樣靈活運用記憶,而非單純複製過往經驗。這項研究的核心觀點在於,記憶應該是「重建的」,而不是「重放的」,為當前AI決策系統的記憶機制帶來了根本性的反思。在目前的技術發展中,檢索過往經驗已成為增強LLM Agent決策能力的常見手段。當Agent面對新任務時,往往會直接調用過去儲存的經驗,並將其作為輔助判斷的依據。然而,這種做法存在一個關鍵缺陷:歷史經驗只有在完全適應當前上下文時,才具有真正的實用價值。

多數現有的記憶增強Agent,會把檢索到的經驗當作靜態記錄,直接注入到當前的對話或決策上下文中,卻很少判斷這些經驗是否真的適合當前的場景。研究團隊指出,如果「舊」經驗與當前的狀態不匹配,直接套用反而可能干擾Agent的決策,導致所謂的「負遷移」效應。這種情況不僅無法提升效能,甚至可能讓Agent做出比沒有記憶輔助時更差的判斷。這凸顯了現有記憶機制在動態環境中的侷限性,也成為推動MemHarness框架誕生的關鍵動機。與人工智慧系統不同,人類在調用記憶時展現出更高的靈活性。人類通常會結合當下的上下文,重新判斷過往經驗該如何應用,從而更好地服務於當前的決策。

這種「經驗重構」的過程,讓人類不會盲目複製過去,而是能夠根據環境變化調整策略。上海AI Lab團隊正是受到這一認知科學啟發,試圖將這種人類的記憶處理方式引入AI Agent的設計中。為此,上海AI Lab團隊與合作者共同提出了「LLM Agent經驗重構」框架,命名為MemHarness。這個框架的核心創新在於,在傳統的「檢索」與「動作」之間,插入了一個顯式的「記憶重構」環節。這個環節並非簡單地將檢索到的經驗直接餵給模型,而是讓Agent主動去「駕馭」(harness)這些經驗,根據當前任務需求進行重新組織與調整。

MemHarness框架的運作方式,可以理解為讓Agent在拿到過往經驗後,先進行一次內部的「思考與改寫」。它會評估哪些經驗是相關的、哪些需要修正、哪些應該被忽略,然後再將這些經過重構的記憶融入決策流程。這種設計讓Agent不再是被動的記憶接收者,而是主動的記憶使用者,從而大幅提升了決策的適應性與準確性。更值得注意的是,MemHarness透過GRPO(一種強化學習演算法)來端到端地學習這項記憶重構能力。這意味著Agent可以在沒有任何人類額外標註資料的情況下,自行透過與環境的互動,學會如何更有效地重構記憶。這不僅降低了對人工標註的依賴,也讓模型能夠在實際應用中持續優化其記憶處理策略。

實驗結果顯示,MemHarness的表現顯著優於純強化學習(RL)方法,以及傳統的靜態記憶增強基線方法。研究團隊進一步指出,該框架在分佈外(OOD)場景中展現出很強的魯棒性。所謂分佈外場景,指的是測試環境與訓練環境存在明顯差異的情況,這正是許多AI系統容易失效的關鍵挑戰。MemHarness在這種情境下仍能維持穩定表現,證明了其記憶重構機制的有效性。這項研究的意義不僅在於提升單一任務的表現,更在於為AI Agent的長期自主學習提供了新的路徑。傳統的記憶增強方法往往會讓Agent陷入「經驗固化」的困境,導致其在面對新情境時缺乏彈性。

而MemHarness透過引入重構機制,讓Agent能夠像人類一樣,在每次決策時都重新審視過往經驗的適用性,從而實現更靈活、更智慧的決策行為。業界分析認為,隨著LLM Agent被廣泛應用於自動化客服、程式碼生成、機器人控制等複雜場景,記憶機制的設計將成為決定系統成敗的關鍵因素之一。MemHarness的提出,為解決當前記憶增強系統的「負遷移」問題提供了一個具體且可落地的解決方案,也為後續研究開闢了新的方向。上海AI Lab團隊表示,未來將進一步探索如何將MemHarness框架擴展到更多元的應用場景,並持續優化其學習效率與記憶重構的品質。

這項研究不僅展現了中國學術界在AI基礎研究上的創新能力,也為全球AI社群提供了一個值得深入探討的技術路徑。隨著相關技術的成熟,未來我們或許能看到更多具備「人類級記憶靈活性」的AI Agent出現在各類應用中。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前