強化學習之父Rich Sutton最新判斷:大模型被困在“局部最優”,AI必須學會持續學習

2026年8月27日 21:14
強化學習之父Rich Sutton最新判斷:大模型被困在“局部最優”,AI必須學會持續學習
站內 AI 整理稿

強化學習先驅理查・薩頓(Richard Sutton)近期再度拋出震撼學界的觀點:當前以大型語言模型為核心的人工智慧,本質上正卡在「局部最優」的困境裡。這位被譽為「強化學習之父」的電腦科學家直言,AI 要真正邁向通用智慧,不能只靠把模型愈練愈大,而是必須發展出具備「持續學習」能力的系統,讓機器像人類一樣,能在既有知識基礎上不斷吸收新經驗、調整舊策略。這個判斷直接挑戰了近年來席捲全球的「大力出奇蹟」路線,也為追逐模型參數競賽的 AI 產業敲響一記警鐘。薩頓所說的「局部最優」,指的是系統在目前給定的條件下已找不到更好的解法,但如果跳出這個框架,其實還有更理想的全局方案。

他認為,現在的大模型正是如此:透過海量資料與巨大算力進行預訓練,模型在靜態資料集上表現得愈來愈好,甚至能通過各種專業考試,但這種「優秀」是受限於訓練資料與目標函數的結果。一旦面對真實世界的動態變化、新出現的知識,或需要跨領域應用的情境,模型就會暴露出僵化與脆弱的本質。換句話說,模型只是在既定山路裡爬到了一個相對高點,卻沒有能力翻越山嶺,看到更廣闊的風景。薩頓指出,人類與動物的學習歷程顯然不是這樣。我們不會在出生時就吸收所有知識,然後終其一生只靠這些記憶應對世事。人類會持續與環境互動,從成功與失敗中調整行為,掌握新技能,甚至改變舊有的認知框架。

這種「持續學習」的能力,正是當前 AI 系統最欠缺的環節。他強調,未來 AI 研究不應只是專注於擴大模型規模、蒐集更多文本,而是要設計出能在部署之後依然不斷自我更新、自我校正的演算法,讓系統在與真實世界互動的過程中,隨時修正自己的判斷,真正適應未知情境。回顧薩頓的學術生涯,這番言論其實縷空了他一貫的核心理念。作為加拿大阿爾伯塔大學的教授,薩頓早在 1980 年代就開始探索以獎懲訊號驅動的學習機制,與他的合作夥伴安德魯・巴托(Andrew Barto)共同奠定了強化學習的理論基礎。

這個領域在一系列 AlphaGo 擊敗人類棋手的里程碑事件中聲名大噪,而薩頓本人則長期對「人工智慧應該從環境中學習」抱持堅定信念。他曾在著名的文章中提到,研究者過度依賴人類知識與手工特徵,是 AI 發展史上一再重蹈的「苦澀教訓」。如今他對大模型的批評,正是這種信念的延伸:先驗知識與靜態資料再豐富,都無法取代與環境互動所產生的學習訊號。薩頓的最新判斷,也讓 AI 社群重新檢視當今研究典範的盲點。大型語言模型被認為擁有「湧現能力」,參數量愈大,愈能完成未曾明確訓練過的任務。但薩頓點出,這些能力本質上仍是從訓練資料的「區域」中組合出來的,並非真正的理解與推理。

如果把模型放到一個持續變動的環境,例如全新的科學領域、快速變遷的社會議題,或是與人類長期共處的機器人場景,缺乏持續學習機制的模型很快就會過時。他認為,這種「一次性訓練」的模式就像培養一名永遠無法畢業的學生:他在學校裡學會所有標準答案,但出了校門卻無法適應任何新挑戰。這番觀點在業界也引發諸多聯想。近年來,不少 AI 公司為了追求更強的模型表現,不惜砸下巨資建設資料中心、囤積 GPU,同時將愈來愈多的資料投入訓練。這種模式確實帶來了亮眼的成績,但也讓模型的生命週期充滿矛盾:資料與算力消耗量驚人,模型卻在訓練完成的那一刻就停止進化。

薩頓所倡議的持續學習,若能實現,將顛覆現有「訓練—部署—淘汰」的循環。模型不再是出廠後就固定不變的產品,而是會在使用者手中持續成長、累積經驗的有機體。這對於自動駕駛、個人助理、醫療診斷等需要不斷適應個別使用者與環境的應用,意義尤其重大。當然,要實現真正的持續學習並不容易。目前主流的深度學習模型在學習新任務時,經常出現「災難性遺忘」——學會新東西,舊知識就被覆蓋掉。如何在保留既有能力的前提下納入新經驗,是過去數十年來持續學習研究的核心難題。薩頓的喊話,等於是把這個冷門挑戰重新推向聚光燈下。

他認為,這個問題不能靠補丁式的記憶重播或資料混入來解決,而是要從學習機制的根本設計上著手,讓模型本身具備動態調整權重、靈活擴展結構的能力。值得注意的是,薩頓並非全然否定大型模型的成就,而是提醒研究者別把目前的成績當成終點。在他眼中,大模型就像一列在功能完善軌道上飛馳的火車,速度雖快,卻終究被困在軌道所能到達的城市。要前往軌道之外的疆域,就得換一種交通工具——不是把鐵軌鋪得更遠,而是讓交通工具本身就是「可以學習如何移動」的存在。這種思維上的轉變,需要產業界、學術界重新配置資源,從投資參數量轉向投資演算法創新,從追逐排行榜分數轉向建構能與世界互動的代理系統。

從更宏觀的視角來看,薩頓的判斷也延續了科技史上對「通用人工智慧」的反覆叩問。每隔一段時間,AI 領域就會出現新的技術熱潮,從專家系統、統計學習到深度神經網路,每一次大步向前,都會引來「AGI 即將到來」的樂觀預期。但薩頓提醒,真正的智慧不應只是對人類知識的壓縮與重組,更包含在未知中探索、從錯誤中學習、在變化中調整的動態能力。如果 AI 無法跨越靜態模型與動態世界之間的鴻溝,那麼無論模型多麼龐大,都只能在局部優化的迷宮裡打轉。薩頓的最新論點,也在學界激起新一波關於 AI 研究方向的辯論。

有人認為他過度悲觀,大模型透過上下文學習、檢索增強等方式,已經具備某種形式的適應力;也有人呼應他的看法,強調業界確實過度依賴規模帶來的紅利,忽略了學習本質上的缺失。無論如何,薩頓以他在強化學習領域的宗師地位,提醒眾人:AI 發展的下一章,不該只是算力的競賽,而是一場關於「如何學習」的更深層革命。唯有讓機器學會持續成長,才能從局部優勢的困局中突圍,真正走向通往通用智慧的廣闊道路。

Related

相關文章

80%訂單是假的?誰在掏錢買人形機器人?

人形機器人正站在科技浪潮的最頂端,從工廠產線到社區服務,彷彿無所不能的願景讓資本為之沸騰。然而,光鮮亮麗的發表會背後,一個尖銳的問題卻始終揮之不去:市場上漫天飛舞的訂單,到底有多少是真的?產業內甚至開始流傳一種說法,指稱高達八成的人形機器人訂單其實是虛假的,所謂的「買家」不過是為了搶佔話題、拉高估值而演出的戲碼。當「賣方市場」的喧囂逐漸退去,究竟誰才是真正掏錢埋單的人,成為當前機器人產業最耐人尋味的懸念。 過去一段時間,人形機器人新創如雨後春筍般湧現,幾乎每間公司都宣稱掌握核心技術,並對外公布令人咋舌的意向訂單。

剛剛

走了半步具身的“四朵雲”,後程無望?

很抱歉,您提供的「可用資料」中並未包含《走了半步具身的「四朵雲」,後程無望?》這篇報導的實際內文,僅有網站導覽、其他文章標題與頁尾資訊等周邊內容。由於缺乏原文的具體事實、數據、人物訪談與論述脈絡,我無法在不虛構資訊的前提下,為您重寫出一篇完整、可刊登的繁體中文科技新聞。 若您能提供該篇文章的正文文字,我將立即為您進行完整的重寫與編排。

剛剛

好消息,DeepSeek營收暴漲10倍,7個月營收4.75億,API毛利82.9%

好消息,DeepSeek營收暴漲10倍,7個月營收4. 9%19分鐘前首款癌症疫苗,一針300萬? 20分鐘前神秘「牛來」模型果然是智譜,GLM首個原生多模態,還用的國產卡11小時前閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇首款癌症疫苗,一針300萬?

剛剛

軟銀洽購1X多數股權,孫正義重回人形機器人牌桌

軟銀集團正洽談收購挪威人形機器人新創1X Technologies的多數股權,此舉讓孫正義睽違多年後重返人形機器人領域,並可能成為軟銀在該領域的最大投資之一。1X專注開發通用型人形機器人,已在物流、保全等場域進行測試,OpenAI也曾參與投資。市場解讀軟銀意在整合AI、半導體與通訊資源,打造從雲端到終端機器人的完整生態鏈,將加劇全球科技巨頭在此領域的競爭。

剛剛

曹操出行上半年營收超百億元,將在香港、阿聯酋部署Robotaxi車隊

曹操出行近日對外披露上半年營運表現,整體營收突破人民幣百億元大關。作為中國大陸主要網約車平台之一,曹操出行在既有出行服務基本盤持續擴張之餘,也同步加快自動駕駛商業化布局,預告將把Robotaxi車隊拓展至香港與阿聯酋,朝向海外與跨境市場邁出新的步伐。 根據公開資訊,曹操出行上半年營收已超過百億元規模,顯示其用戶需求與訂單量維持穩定成長。這家以新能源車隊起家的平台,過去數年陸續在不同城市試營運自動駕駛計程車服務,如今進一步將目光投向海外。

剛剛