69歲強化學習之父Richard Sutton創業:造20瓦人腦級智能體

重點摘要
69歲的強化學習之父、2024年圖靈獎得主Richard Sutton近日宣布創業,他與學生Khurram Javed一同離開John Carmack創辦的Keen Technologies,成立全新實驗室Oak Lab。這位現代強化學習的奠基人,為這個領域帶來了時序差分演算法,並與導師Andrew Barto合寫了全球通用的教材《強化學習導論》,如今他決定用自己的方式重新定義智能。 Sutton的學術與業界經歷堪稱傳奇。
69歲的強化學習之父、2024年圖靈獎得主Richard Sutton近日宣布創業,他與學生Khurram Javed一同離開John Carmack創辦的Keen Technologies,成立全新實驗室Oak Lab。這位現代強化學習的奠基人,為這個領域帶來了時序差分演算法,並與導師Andrew Barto合寫了全球通用的教材《強化學習導論》,如今他決定用自己的方式重新定義智能。Sutton的學術與業界經歷堪稱傳奇。他畢業於史丹佛心理學系,博士期間師從強化學習先驅Andrew Barto,之後陸續在GTE Labs與AT&T Labs做研究。
2003年起,他長年擔任阿爾伯塔大學全職教授,創辦強化學習實驗室RLAI;2017年至2023年則任職DeepMind傑出研究科學家,主導建立Edmonton研究團隊。在四十多年的職業生涯中,他培育出大批AI頂尖人才,包括AlphaGo核心設計者David Silver、DeepMind蒙特婁負責人Doina Precup、博弈AI專家Michael Bowling,以及這次共同創業的Khurram Javed。Oak Lab的終極目標相當大膽:打造一個擁有萬億參數規模、能夠即時學習與即時規劃、且整機功耗僅20瓦的智能體。20瓦正好與人腦的能耗水準相當。
當整個AI行業仍在拼命堆疊GPU與擴張數據中心時,這位強化學習的祖師爺打算從根本重新思考智慧的運作方式。要理解Sutton為何離開Keen Technologies,得先知道他當初為什麼加入。Keen Technologies的創辦人John Carmack是《毀滅戰士》與《雷神之鎚》的開發者、Oculus前CTO,在程式圈被稱為「卡神」。2022年他離開Meta全力投入AI創業,方向同樣是強化學習。
2023年9月,Sutton因為Google DeepMind關閉他在加拿大Edmonton共創的實驗室而選擇加入Keen,當時兩人的聯手被視為夢幻組合——一個是底層系統工程的傳奇,一個是強化學習理論的奠基者,計劃在2030年前打造出具備「AGI生命跡象」的原型系統。然而合作還不滿三年,Sutton便決定抽身。他在推文中特別強調,對John Carmack與Keen Technologies「怎麼誇都不為過」,言下之意分手並非因為Carmack不好,而是雙方對如何達到終點產生了根本分歧。
在Sutton看來,當前深度學習的整套發展路線行不通,模型不需要無休止的迭代微調,整個行業亟需一場範式級別的顛覆與重建。那麼Oak Lab打算怎麼做?Sutton的核心信念可以濃縮為一句話:智慧來自運行過程中持續產生的經驗。目前主流大模型的工作模式,是耗費數月與巨額成本,依託海量文本數據進行離線預訓練;訓練結束後模型參數基本固定,之後雖然每天與億萬用戶對話,絕大多數交流內容卻無法轉化為模型的全新能力。它只能複用訓練階段學到的知識,或是在對話上下文裡短暫記住資訊,沒辦法像人類或動物一樣在持續感知外界時不斷更新自我。Oak Lab要打造的智能體截然不同。
它會一邊感知周遭環境、採取行動,再根據結果調整自身行為;只要產生新的經歷,學習就同步進行,不需要間隔很久再集中訓練。正如Sutton自己所說:AI運行的每一刻,都應該是學習的過程。研究團隊已公布核心架構OaK,代表Options and Knowledge,也就是技能與知識。這套架構讓智能體從自身經驗中發掘具有時間跨度的抽象結構,轉化為可以驗證、規劃並反覆調用的技能。舉例來說,機器人第一次去廚房接水,整個流程包含辨識房間、避開障礙、拿起水杯、打開水龍頭等一系列動作;傳統AI會把所有步驟視為單次決策任務,但OaK架構會讓智能體從實際操作中拆解出「走到廚房」「拿起杯子」「接水」等高層級技能。
日後遇到類似目標時,智能體就能直接調用既有技能,再結合當下環境靈活調整方案。更特別的是,Oak架構在學習階段既不儲存歷史數據,也不會回放過去經驗。當今的深度強化學習往往會把大量歷史經驗放進緩衝區反覆抽樣訓練,但Oak Lab設想採用batch size為1的即時學習方式,每得到一條新經驗就立刻完成一次更新。團隊相信,如果這類演算法能與事件驅動的神經網路結合,系統所需的計算量與能耗有機會下降好幾個數量級,讓持續、即時的學習變得真正可行。萬億參數、即時學習、即時規劃、20瓦功耗的遠期目標,正是建立在這樣的研究路徑之上。
Oak Lab背後還有一塊理論基石,來自Sutton與Javed共同提出的大世界假說。核心觀點是:真實世界永遠比AI更加複雜,無論模型做得再強大,外界環境的數據量同樣會跟著暴漲。依靠預先整理好的數據訓練出來的模型,根本跟不上現實的變化。AI必須學會選擇性地記住有用資訊,適時遺忘過時內容,持續在線學習,才能在真實世界中適應。熟悉Sutton的人對這套觀點應該不會太意外。2019年他寫下AI領域廣為流傳的短文〈苦澀的教訓〉,回顧西洋棋、圍棋、語音辨識與電腦視覺的發展歷程,得出一個結論:能夠隨計算規模擴展的通用學習與搜索方法,長期下來終將勝過依賴人類手工知識的系統。
到了大模型時代,這條路線似乎獲得強力驗證——更大的模型、更多的數據、更強的算力,讓AI能力一路飆升。但Sutton對當前的主流深度學習依然不滿。他認為現在的系統高度依賴人類生產、篩選並整理過的數據,模型學習的內容主要是人類過去已經寫下、拍下或標註過的東西。真正的智能體,需要透過自身的行動產生新經驗,再利用這些經驗去追求長期目標。這也解釋了他為何從「苦澀的教訓」進一步走向「經驗時代」——2025年他與AlphaGo核心人物David Silver共同提出,AI將逐步從依賴人類數據轉向依靠智能體與環境互動產生的經驗。Oak Lab正是這套研究主張的創業化落地。
四十年前,Sutton在博士論文裡寫下「強化學習中的時序信用分配」時,強化學習還是一門冷板凳學問。四十年後,整個世界都在追逐大模型的商業化浪潮,他依然在追問同一個問題:智慧到底是怎麼來的?而這位69歲的老將選擇用創業給出自己的答案。據悉,Oak Lab成立後的第一站公開活動將是上海WAIC,Sutton會在思想者論壇帶來題為〈強化學習的第一性:從經驗培育超級智能〉的主題分享。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。