強化學習大本營新作:如何破解「學新忘舊」困局

阿爾伯塔大學FAME框架給出數學最優解 在人工智慧的研究版圖中,強化學習一直被視為通往通用智慧的重要路徑。然而,一個長期困擾學界的「幽靈」始終揮之不去:當智慧體在連續的任務流中學習新技能時,往往會以災難性的速度遺忘舊有知識。這種被稱為「學新忘舊」的災難性遺忘問題,在動態變化的真實環境中尤其致命。試想,一個機器人若在學會組裝零件後,為了學會搬運貨物而徹底忘記前者,這在工業應用中無疑是一場災難。長期以來,這被視為強化學習領域最棘手的挑戰之一,但來自阿爾伯塔大學的頂尖研究團隊,近期提出了一項名為FAME的創新框架,試圖從數學根源上徹底破解此困局。
困境的本質:參數覆蓋與記憶消逝 要理解FAME的突破,首先必須正視問題的根源。傳統的深度強化學習模型,其「記憶」本質上儲存在神經網絡的參數中。當代理學習新任務時,梯度下降演算法會為了優化當前任務的獎勵,而大幅調整這些參數。這個過程就像是新墨水覆蓋了舊字跡,舊任務的經驗表徵在參數空間中被無情地沖刷殆盡。過往的解決方案,如「經驗重放」,試圖透過儲存舊任務的樣本數據,在新任務訓練時混入重放,但這不僅對儲存空間提出了無限需求,更在面對高維度連續控制任務時,因數據分佈的偏移而效果大打折扣。另一類方法則依賴於正則化項,但懲罰係數的調節如同一場噩夢,過強則新任務學不動,過弱則遺忘照舊。
FAME的核心思路:將遺忘轉化為可求解的約束 阿爾伯塔大學團隊提出的FAME框架,其高明之處在於徹底跳出了「記憶數據」的思維定勢。他們不再試圖讓模型「記住」舊樣本,而是將「遺忘」本身建模為一個參數空間中的約束條件。換言之,FAME不追求記憶所有舊樣本,而是讓新策略在更新時「繞開」舊策略的關鍵參數區域。在策略梯度的計算中,FAME引入了一個可動態調整的懲罰項,這個懲罰項的數學意義在於:強制新任務的學習方向與舊任務的穩態解保持一個幾何距離。透過這種方式,新任務的學習過程被限制在一個不會破壞舊任務關鍵性能的區域內,從而在數學上嚴格保證了遺忘的上界。
雙階段交替:低秩近似與行為特徵提取 FAME框架的具體實現,體現在一個精巧的雙階段交替優化過程中。在第一個階段,演算法會對當前任務進行標準的策略優化,讓代理充分探索並學習新技能。緊接著,在第二個階段,FAME會對舊任務的「行為特徵」進行低秩近似。這裡的「行為特徵」並非原始像素或狀態,而是指策略網絡在決策時所依賴的核心表徵方向。透過低秩近似,FAME能將這些高維特徵壓縮為少數幾個關鍵向量,並將這些向量作為約束條件,注入下一輪的更新中。這種設計巧妙地避免了傳統經驗重放對儲存空間的無限需求,同時也解決了正則化方法中懲罰係數難以調節的痛點,因為其約束是基於幾何結構而非人為設定的權重。
實驗數據的強力背書:5%對比20% 理論的優雅必須經受實務的檢驗。在連續控制任務序列的基準測試中,FAME的表現令人矚目。實驗數據顯示,在面對一連串不同但相關的連續控制任務時,FAME能在保持新任務性能不下降的同時,將舊任務的獎勵衰減率控制在5%以內。這意味著,代理在學會新技能後,對舊技能的掌握幾乎沒有損失。作為對比,目前學界廣為使用的彈性權重鞏固(EWC)方法,在完全相同的條件下,舊任務的獎勵衰減率卻超過了20%。這懸殊的數據差距,直觀地證明了FAME在處理持續學習問題上的壓倒性優勢。
從「記憶重放」到「幾何規避」的典範轉移 FAME的意義不僅在於提供了一個更優秀的演算法,更在於它代表了一種範式轉移。傳統的持續學習研究,往往陷入「記憶」的泥潭,試圖透過各種方式儲存和重放舊數據。而FAME則提供了一個全新的視角:既然遺忘的本質是參數的覆蓋,那麼我們何不直接從參數空間的幾何結構下手?透過將舊任務的穩態解視為一個「禁區」,並在新任務的優化路徑上設置「繞行」的懲罰,FAME將一個看似無解的動態困境,轉化為一個靜態的、可求解的優化公式。這種思路,為強化學習代理在面對無盡任務流時,提供了一種更為優雅且高效的解決方案。
實務落地的潛力:從機器人到自動駕駛 FAME的出現,不僅僅是學術論文上的一個亮點,它更代表著強化學習從實驗室走向真實應用的關鍵一步。在工業機器人領域,生產線上的任務往往需要頻繁切換,從焊接、組裝到搬運,一個能「學新不忘舊」的代理將能極大地提升生產彈性與效率。在自動駕駛領域,車輛需要在不同的天氣、路況和交通規則下持續學習,FAME能確保車輛在適應新場景時,不會遺忘在舊場景中學到的安全駕駛策略。這意味著,FAME提供的不只是理論上的「可求解公式」,更是一個實務上可落地的持續學習基準,讓強化學習代理在面對無盡任務流時,不再需要「遺忘」作為學習的代價。
挑戰與展望:動態環境的進一步考驗 當然,FAME並非萬能的終點。目前的研究成果主要基於連續控制任務序列,對於更為複雜的、任務邊界模糊的開放式環境,FAME的約束條件是否依然能保持穩健,仍需進一步驗證。此外,如何自動化地決定「舊任務」的範圍,以及如何處理任務之間存在衝突的極端情況,也是未來研究的方向。但不可否認,FAME已經為持續強化學習領域樹立了一個新的標竿,它證明了透過數學建模與幾何約束,我們完全可以設計出一個既高效又穩健的學習系統。結論:告別「遺忘」的代價 在人工智慧的漫長征途中,記憶與學習的平衡始終是核心命題。
阿爾伯塔大學的FAME框架,以其獨特的「幾何避障」策略,為我們提供了一個令人振奮的答案。它告訴我們,面對「學新忘舊」的困局,我們不必再在「儲存」與「遺忘」之間痛苦地妥協。透過將遺忘建模為可求解的約束,FAME讓強化學習代理在無盡的任務流中,既能擁抱新知,也能穩固舊學。這項研究的突破,不僅為學術界提供了強而有力的工具,更為未來真正具備持續學習能力的通用人工智慧,鋪平了一條堅實的道路。當AI不再需要以遺忘作為學習的代價,我們離那個能不斷進化、適應一切的智慧體,又近了一大步。
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床
AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。