在WAIC現場,我們見到了Richard Sutton

重點摘要
強化學習奠基人Richard Sutton在WAIC現場與與會者交流,強調獎勵機制與持續學習在AI發展中的核心地位。他回應演算法泛化問題時指出,當前AI系統需強化對時間序列與因果關係的建模。此次會面凸顯WAIC作為學術與產業橋樑的角色,為參與者帶來啟發。
在上海舉辦的世界人工智慧大會(WAIC)現場,強化學習領域的奠基人之一、加拿大阿爾伯塔大學教授 Richard Sutton 的現身,成為會場上最受矚目的焦點之一。這位被譽為「強化學習之父」的學者,不僅在學術界擁有舉足輕重的地位,其提出的 Temporal Difference Learning 與 Policy Gradient 等方法,更是現代 AI 突破的關鍵基石。他在 WAIC 的出現,讓眾多與會研究者與產業人士有機會近距離聆聽大師的觀點,並進行深入的交流互動。 Sutton 在大會演講中,再度強調了獎勵機制與持續學習在人工智慧發展中的核心地位。他認為,無論是當前的深度學習還是未來更先進的系統,都必須建立在明確的獎勵信號之上,才能引導代理(agent)學習出有意義的行為。同時,他也特別指出,當前的 AI 模型往往在固定資料集上訓練完成後就停止學習,這樣的模式無法適應真實世界中不斷變化的環境。真正的智慧應該具備持續學習的能力,在與環境互動的過程中不斷調整策略,這也是強化學習最根本的精神。 在演講後的互動環節中,有與會者提出了關於演算法泛化能力的問題。Sutton 回應時坦言,現在許多 AI 系統雖然在特定任務上表現驚人,但在面對新情境或時間序列變化時,仍然顯得脆弱。他特別強調,當前的 AI 系統需要更強化對時間序列結構與因果關係的建模能力。他指出,許多機器學習方法只關注靜態的相關性,而忽略了事件發生的先後順序與因果鏈,這限制了系統真正理解世界並做出理性決策的可能性。他的觀點為現場的研究者帶來了新的思考方向,也促使許多人重新檢視當前熱門的大型語言模型與強化學習結合的潛力。 這場近距離的交流,不僅讓參與者得以直接從大師的經驗中汲取靈感,更展現了 WAIC 作為學術與產業橋樑的特殊角色。在 AI 技術快速迭代的當下,學術界的前沿理論往往需要數年才能落地為產業應用,而像 Sutton 這樣的重量級學者親自站上產業舞台,無疑能加速這項轉化。許多與會的新創公司技術長與大學實驗室研究員都表示,Sutton 的提醒讓他們更加重視獎勵函數的設計以及持續學習機制的架構,這可能直接影響他們下一階段產品或研究的發展方向。 值得一提的是,Sutton 在現場並未特別針對當前熱門的生成式 AI 或大型語言模型做出評價,而是回歸到強化學習的本質問題。他認為,無論技術如何演進,讓機器從與環境的互動中自主學習,始終是通往通用人工智慧(AGI)最可靠的途徑。這種「老派」但紮實的觀點,讓不少年輕研究員感到耳目一新,也提醒業界不要過度追逐短期熱點,而忽略了長期的基礎研究。 WAIC 現場的氣氛在 Sutton 的演講後達到高潮,許多與會者排隊等候與他交換名片或提問。一位來自北京大學的博士生表示,平時只能在論文上看到 Sutton 的名字,沒想到能在上海親自聽到他的分享,尤其是關於因果關係建模的建議,讓他對自己正在進行的研究有了新的靈感。另一位來自深圳的 AI 工程師則說,Sutton 對於持續學習的強調,讓他反思目前公司產品在模型更新上的瓶頸,或許應該從強化學習的框架中尋找解決方案。 此次會面不僅凸顯了 WAIC 在全球 AI 生態中的影響力,也證明了學術領袖與產業實務之間的對話,對於推動人工智慧整體進步具有不可替代的價值。Sutton 的觀點雖然看似樸素,卻直指當前 AI 發展的瓶頸所在:過度依賴大規模靜態資料與預訓練,而忽略了時間動態與因果推論的重要性。這不僅為現場的研究者提供了新的思考方向,也為整個 AI 社群勾勒出一個更貼近真實世界的發展藍圖。 隨著大會圓滿落幕,許多與會者仍津津樂道於與 Sutton 的互動。一位長期關注強化學習的投資人表示,他從 Sutton 的演講中看到了一個信號:未來 AI 的競爭力,可能不再只是模型參數量的比拼,而是誰能讓系統在真實世界中持續學習、適應變化。這或許正是 WAIC 這場盛會留給業界最深刻的啟示。
Related
相關文章

我做了個新聞聯播版《甄嬛傳》,全靠這款字節模型
字節跳動推出音頻創作模型Seed Audio 1.0,可透過提示詞生成包含對白、音效與環境聲的完整聲音場景,並支援多語種與角色一致性。實際測試顯示,該模型在聲音模仿、複雜場景編排表現突出,但部分音頻仍帶有AI感,情緒細節與真實度有待提升。

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了
李飛飛團隊發表首篇機器人觸覺感知論文,機器人可透過盲摸方式辨識麻將牌,展現缺乏視覺下的精細物件分類能力。該技術與SHARPA靈巧手結合,提供高解析度觸覺感測,為物理AI的感知能力開創新路徑,未來可應用於黑暗、高粉塵等視線受阻環境。

研究:AI 會削弱人類批判性思維,降低人們說“我不知道”的意願
首頁 > 智能時代>人工智能 研究:AI 會削弱人類批判性思維,降低人們說“我不知道”的意願 2026/7/20 20:29:11 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 Coje_He 的線索投遞! IT之家 7 月 20 日消息,2026 年,AI 依然會出現“幻覺”(hallucination),並且經常給出錯誤答案。

AI領走埃爾德什100美元賞金,44頁頂刊沒解的題,它一頁紙答出
這篇消息聚焦「AI領走埃爾德什100美元賞金,44頁頂刊沒解的題,它一頁紙答出」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

國傢俱身智能應用中試基地發佈首個合作世界模型 魔芯科技MoWorld 3D正式亮相
國家級具身智能應用中試基地近日宣布,正式發布其首個合作世界模型,並同步公開魔芯科技所開發的 MoWorld 3D 產品。這項合作標誌著中試基地在具身智能領域的技術驗證與應用落地邁出關鍵一步,也為 3D 世界模型的商業化路徑提供新的參考案例。 MoWorld 3D 由魔芯科技打造,是一款專注於三維空間理解與生成的世界模型。

Token工廠、世界模型、AI手機,WAIC的三大新風向
2024年世界人工智能大會揭示三大新風向:Token工廠、世界模型及AI手機,代表AI從技術突破轉向基礎設施與終端整合。國產算力集團軍正式亮相,展現中國在算力自主化上的集體進展,具身智能也宣告進入實際場景部署階段。