清華陶建華團隊提出「自進化同策略蒸餾」SEED:讓Agentic RL訓練也懂事後監督

2026年7月21日 21:46
清華陶建華團隊提出「自進化同策略蒸餾」SEED:讓Agentic RL訓練也懂事後監督

重點摘要

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

站內 AI 整理稿

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作清華陶建華團隊提出「自進化同策略蒸餾」SEED:讓Agentic RL訓練也懂事後監督賬號已註銷·2026年07月21日 21:35長程Agent訓練新突破。 如何讓交互式 Agent 能像人類一樣學會“事後覆盤”,更好地處理長程任務? 如今,強化學習(RL)已經成為重要的後訓練範式。 然而,在長程 Agentic 學習中,基於結果的 RL 仍存在監督缺口: 失敗軌跡可能包含有用行為,一條成功軌跡也可能包含可複用策略,但基於結果的強化學習只能判斷任務成敗,難以指出哪些中間觀察、動作或工具調用應該被強化。 針對這個問題,清華大學清華大學自動化系常聘教授陶建華團隊及其合作者提出了“自進化同策略框架”(SElf-Evolving On-Policy Distillation,SEED),將已完成的同策略軌跡轉化為訓練時的事後(hindsight)技能,並將這些技能的行為效果蒸餾回策略模型中。 14777 結果顯示,基於文本和基於視覺的智能體任務上的大量實驗表明,SEED 能夠持續提升性能和樣本效率,並展現出對未見場景的魯棒泛化能力。 研究團隊表示,SEED 只使用已學習到的策略,在推理時無需外部記憶或額外提示,也能保留可複用的行為經驗。 SEED:自進化同策略框架 SEED 是一個自進化 OPD 框架,它會把當前策略完成的任務軌跡總結為後見技能,並將這些 skills 的行為指導蒸餾回策略模型。 由此形成的訓練信號有三個特點:它來自當前策略的軌跡,能夠細化到單個決策詞token,並會隨著策略更新一起進化。

Related

相關文章

鈦媒體AI Agent

對話小米俞之奡:從泰坦合金到電池,AI正批量製造材料“六邊形戰士”

對話小米俞之奡:從泰坦合金到電池,AI正批量製造材料“六邊形戰士”LCC_Beta版2026.07.21 13:01 · 來自北京全文5291字00:00 / 14:52告別小模型,“AI+材料”進入Agent Workflow。小米AI+新材料負責人俞之奡,圖片由其本人提供在硅基智能以光速迭代的時代,材料界正在面臨一種令人尷尬的速度差。

5 小時前
IT之家AI Agent

騰訊混元發佈科學發現智能體 Hyra,能夠遞歸自我改進

首頁 > 智能時代>人工智能 騰訊混元發佈科學發現智能體 Hyra,能夠遞歸自我改進 2026/7/21 11:43:22 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 21 日消息,騰訊混元今日推出 Hyra-1.0,這是 Hyra(Hunyuan Research Agent)的首個版本:一個能夠遞歸自我改進、專為性能導向的研究與工程任務打造的智能體。騰訊表示,除了公開基準,它還能在產品系統裡,在真實的 AI 研發流水線上,在自然科學研究乃至工業場景裡學習和進化。過去一年,遞歸自我改進(RSI)與自動化研究成為 AI 領域最活躍的前沿問題之一。Google DeepMind 的 AlphaEvolve 只用 48 次標量乘法就完成了 4×4 複數矩陣相乘。Together AI 讓一群智能體在開放環境中協作,把 11 維 kissing number 的已知下界從 593 推進到 604。Andrej Karpathy 的 autoresearch 展示了一套精簡的循環,讓模型訓練研究自主運轉。此後,一批進化型系統接連湧現:智能體正在跨越封閉的基準測試,在開放的科學發現中超越人類。騰訊混元 Hyra 的 Harness 設計原則遵循 The Bitter Lesson:框架儘量輕量簡單,智能體的動作空間儘量廣闊。給定任務描述,Hyra 持續運行一個循環:基於歷史經驗探索提出更好的 solution。歷史經驗包含過去 solution 運行的日誌、評估器反饋、solution 的源代碼等。循環直到 Agent 主動結束或預算耗盡,最終返回歷史最優的方案。比如,讓 Hyra 僅根據一張 2D 參考圖像設計物體的三維結構,並生成可渲染的 3D 模型,使用基於 rubrics 的 VLM judge,從輪廓、比例、結構完整性、材質和視覺相似度等維度評價結果。

6 小時前
IT之家AI Agent

消息稱阿里將推“千問辦公”:合併旗下三款智能體,釘釘新任 CEO 陳宇森負責

首頁 > 智能時代>人工智能 消息稱阿里將推“千問辦公”:合併旗下三款智能體,釘釘新任 CEO 陳宇森負責 2026/7/21 11:25:03 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 21 日消息,《財經》雜誌今天(21 日)上午發佈消息稱,阿里將推出千問辦公,且已經整合 QoderWork、悟空、MuleRun 這三款智能體產品。

6 小時前
IT之家AI Agent

三體宇宙展望“智子”智能體:有共識、有記憶、有人格,持續陪伴

# 三體宇宙展望“智子”智能體:有共識、有記憶、有人格,持續陪伴 在2026年世界人工智能大會(WAIC)無問芯穹“Token湧現,萬物生長——Agentic AI產業生態論壇”上,三體宇宙CEO趙驥龍正式對外披露了其基於《三體》經典IP打造的“智子”智能體最新構想。這一全新概念描繪的不僅是一個工具型AI助手,而是一個具備共識、記憶與人格特質,能夠與用戶長期互動、持續陪伴的智能體形象。在Agentic AI浪潮席捲全球的當下,這一設想引發了業界廣泛關注。

8 小時前
AIBaseAI Agent

消息稱阿里將推出千問辦公,整合三款智能體佈局AI辦公市場

AI資訊AI新閒資訊正文消息稱阿里將推出千問辦公,整合三款智能體佈局AI辦公市場發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘7月21日,據《財經》報道,阿里計劃推出“千問辦公”產品,並已完成對旗下QoderWork、悟空、MuleRun三款智能體(Agent)產品的整合。該產品將成為阿里面向Agent辦公市場的重要佈局,負責推動企業辦公場景中的AI應用落地。據瞭解,千問辦公由釘釘新任CEO陳宇森負責。

10 小時前6400