清華陶建華團隊提出「自進化同策略蒸餾」SEED:讓Agentic RL訓練也懂事後監督

2026年7月21日 21:46
清華陶建華團隊提出「自進化同策略蒸餾」SEED:讓Agentic RL訓練也懂事後監督

重點摘要

清華大學陶建華團隊提出「自進化同策略蒸餾」(SEED)框架,解決長程Agent強化學習中僅基於結果的監督不足問題。SEED將同策略軌跡轉化為事後技能並蒸餾回模型,能細化到單個決策token,在文本與視覺任務上顯著提升性能與泛化能力。

站內 AI 整理稿

清華大學自動化系常聘教授陶建華團隊與合作者近日提出一項名為「自進化同策略蒸餾」(SElf-Evolving On-Policy Distillation,簡稱SEED)的全新框架,旨在解決長程Agent任務中強化學習(RL)訓練的監督缺口問題。這項研究讓互動式AI智能體能夠像人類一樣學會「事後覆盤」,從已完成任務的軌跡中提煉可重複使用的行為經驗,進而提升在複雜長程任務中的表現。強化學習目前已成為大型語言模型後訓練階段的重要範式,尤其在需要與環境反覆互動的Agentic學習場景中,RL能夠幫助模型逐步優化決策策略。

然而,在處理長程任務時,傳統基於結果的強化學習存在明顯的監督限制:模型只能根據任務最終的成功或失敗來調整行為,卻無法精確判斷在過程中的哪些中間觀察、動作或工具調用應該被強化。這意味著,一條失敗的軌跡中可能包含部分有用的行為,而一條成功的軌跡也可能隱藏著可複用的策略,但現有方法難以將這些細粒度的資訊提取出來。針對這一瓶頸,陶建華團隊提出的SEED框架,將已完成任務的「同策略軌跡」轉化為訓練階段的事後技能(hindsight skills),再透過蒸餾機制將這些技能的行為指導回饋給策略模型。這個過程不需要外部記憶或額外提示,僅依賴當前策略自身已經學習到的知識,就能在推理時保留可複用的行為經驗。

SEED的核心運作邏輯是「自進化」與「同策略」的結合。所謂「同策略」,指的是框架所使用的訓練資料完全來自當前策略模型在執行任務時產生的軌跡,而非依賴其他模型或預先收集的資料庫。這確保了訓練信號與模型當下的能力水準保持一致,避免因策略更新而產生的資料分佈偏移問題。而「自進化」則體現在,隨著策略模型不斷更新,SEED也會同步從新的軌跡中提煉出更精準的技能,形成一個持續優化的正向循環。具體來說,SEED框架會將當前策略完成任務的完整軌跡——包含觀察、動作序列與工具調用——進行總結,提煉為「後見技能」。這些技能並非抽象的高層次規則,而是能夠細化到單個決策詞(token)層級的行為指導。

接著,框架透過蒸餾技術,將這些技能的行為效果回饋給策略模型,使模型在後續任務中能夠更有效地運用這些經驗。研究團隊在基於文本與基於視覺的智能體任務上進行了大量實驗,結果顯示SEED能夠持續提升模型的性能與樣本效率。與傳統基於結果的強化學習相比,SEED不僅在訓練階段更快收斂,在面對未見過的場景時也展現出更強的魯棒泛化能力。這意味著,經過SEED訓練的Agent能夠在全新環境中更穩定地執行任務,而不會因為場景變化而導致性能大幅下滑。值得注意的是,SEED在推理階段不需要任何外部記憶或額外提示,完全依賴策略模型自身已學習到的知識。

這項設計大幅降低了部署時的計算與儲存成本,同時也讓模型的行為更加自主與靈活。研究團隊指出,SEED所產生的訓練信號具備三個關鍵特點:它來自當前策略的軌跡,確保資料的即時性與相關性;它能細化到單個決策詞層級,提供精準的行為指導;它會隨著策略更新一起進化,使模型能夠持續從自身經驗中學習。這項研究的發表,為長程Agent訓練提供了一個全新的思路。傳統強化學習在處理需要多步推理與工具調用的複雜任務時,往往面臨獎勵稀疏、監督不足的困境。SEED透過將已完成軌跡轉化為可蒸餾的技能,有效填補了基於結果的RL在過程監督上的缺口,讓模型能夠從每一次任務中學到更多有價值的行為模式。

業界分析認為,SEED的提出對於發展更自主、更高效的AI智能體具有重要意義。隨著大型語言模型在自動化任務、程式碼生成、網頁操作等領域的應用日益廣泛,如何讓模型在長程互動中持續學習與改進,已成為當前AI研究的關鍵課題。SEED所展現的自進化能力與樣本效率優勢,有望在未來被廣泛應用於各類需要長期規劃與互動的AI系統中。目前,該研究團隊已公開相關論文與實驗細節,後續將進一步探索SEED在更多複雜場景中的應用潛力,包括多模態任務、多智能體協作以及開放式環境中的自主學習。這項成果不僅為學術界提供了新的研究方向,也為產業界在開發更聰明、更可靠的AI助手時,帶來了一個值得參考的技術路徑。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

2 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

5 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

8 小時前