在WAIC現場,我們見到了Richard Sutton

重點摘要
強化學習奠基人Richard Sutton在WAIC現場與與會者交流,強調獎勵機制與持續學習在AI發展中的核心地位。他回應演算法泛化問題時指出,當前AI系統需強化對時間序列與因果關係的建模。此次會面凸顯WAIC作為學術與產業橋樑的角色,為參與者帶來啟發。
在上海舉辦的世界人工智慧大會(WAIC)現場,強化學習領域的奠基人之一、加拿大阿爾伯塔大學教授 Richard Sutton 的現身,成為會場上最受矚目的焦點之一。這位被譽為「強化學習之父」的學者,不僅在學術界擁有舉足輕重的地位,其提出的 Temporal Difference Learning 與 Policy Gradient 等方法,更是現代 AI 突破的關鍵基石。他在 WAIC 的出現,讓眾多與會研究者與產業人士有機會近距離聆聽大師的觀點,並進行深入的交流互動。Sutton 在大會演講中,再度強調了獎勵機制與持續學習在人工智慧發展中的核心地位。
他認為,無論是當前的深度學習還是未來更先進的系統,都必須建立在明確的獎勵信號之上,才能引導代理(agent)學習出有意義的行為。同時,他也特別指出,當前的 AI 模型往往在固定資料集上訓練完成後就停止學習,這樣的模式無法適應真實世界中不斷變化的環境。真正的智慧應該具備持續學習的能力,在與環境互動的過程中不斷調整策略,這也是強化學習最根本的精神。在演講後的互動環節中,有與會者提出了關於演算法泛化能力的問題。Sutton 回應時坦言,現在許多 AI 系統雖然在特定任務上表現驚人,但在面對新情境或時間序列變化時,仍然顯得脆弱。
他特別強調,當前的 AI 系統需要更強化對時間序列結構與因果關係的建模能力。他指出,許多機器學習方法只關注靜態的相關性,而忽略了事件發生的先後順序與因果鏈,這限制了系統真正理解世界並做出理性決策的可能性。他的觀點為現場的研究者帶來了新的思考方向,也促使許多人重新檢視當前熱門的大型語言模型與強化學習結合的潛力。這場近距離的交流,不僅讓參與者得以直接從大師的經驗中汲取靈感,更展現了 WAIC 作為學術與產業橋樑的特殊角色。在 AI 技術快速迭代的當下,學術界的前沿理論往往需要數年才能落地為產業應用,而像 Sutton 這樣的重量級學者親自站上產業舞台,無疑能加速這項轉化。
許多與會的新創公司技術長與大學實驗室研究員都表示,Sutton 的提醒讓他們更加重視獎勵函數的設計以及持續學習機制的架構,這可能直接影響他們下一階段產品或研究的發展方向。值得一提的是,Sutton 在現場並未特別針對當前熱門的生成式 AI 或大型語言模型做出評價,而是回歸到強化學習的本質問題。他認為,無論技術如何演進,讓機器從與環境的互動中自主學習,始終是通往通用人工智慧(AGI)最可靠的途徑。這種「老派」但紮實的觀點,讓不少年輕研究員感到耳目一新,也提醒業界不要過度追逐短期熱點,而忽略了長期的基礎研究。
WAIC 現場的氣氛在 Sutton 的演講後達到高潮,許多與會者排隊等候與他交換名片或提問。一位來自北京大學的博士生表示,平時只能在論文上看到 Sutton 的名字,沒想到能在上海親自聽到他的分享,尤其是關於因果關係建模的建議,讓他對自己正在進行的研究有了新的靈感。另一位來自深圳的 AI 工程師則說,Sutton 對於持續學習的強調,讓他反思目前公司產品在模型更新上的瓶頸,或許應該從強化學習的框架中尋找解決方案。此次會面不僅凸顯了 WAIC 在全球 AI 生態中的影響力,也證明了學術領袖與產業實務之間的對話,對於推動人工智慧整體進步具有不可替代的價值。
Sutton 的觀點雖然看似樸素,卻直指當前 AI 發展的瓶頸所在:過度依賴大規模靜態資料與預訓練,而忽略了時間動態與因果推論的重要性。這不僅為現場的研究者提供了新的思考方向,也為整個 AI 社群勾勒出一個更貼近真實世界的發展藍圖。隨著大會圓滿落幕,許多與會者仍津津樂道於與 Sutton 的互動。一位長期關注強化學習的投資人表示,他從 Sutton 的演講中看到了一個信號:未來 AI 的競爭力,可能不再只是模型參數量的比拼,而是誰能讓系統在真實世界中持續學習、適應變化。這或許正是 WAIC 這場盛會留給業界最深刻的啟示。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。