當 AI 開始給自己動刀,“智能爆炸”可能真不遠了:兩篇論文拆解AI下一步進化路徑

硅谷Tech news2026.09.23 10:17 · 來自北京全文6004字00:00 / 14:22當 AI 開始“改進自己”,AI 的下一個躍遷,取決於在群體中相互成就。最近,AI 圈同時被兩件事刷了屏:一邊是 MIT 材料科學家 Markus J.Buehler 的長文(題為 Recursive Meta-Intelligence,與 SwarmWorld 互為呼應)一週內引來二十多萬次圍觀;另一邊,DAIR.AI 力薦的一篇論文登上了 Hugging Face 日榜第二名。兩條推文看似毫無交集,指向的卻是一個趨勢——AI 正在學會改進自己。
Buehler 團隊的 SwarmWorld,講的是“一群 AI 如何通過共同生活的世界悄悄把彼此變強”;DAIR.AI 推薦的 ModularRSI,講的則是“單個 AI 如何給自己的執行框架動手術”。一個來自 MIT,一個來自北航、曼徹斯特大學、瀾舟科技等組成的團隊;一個面向材料科學,一個面向軟件工程。它們像是同一命題的兩種解法,而這命題正是眼下最熱的“遞歸式自我改進”(Recursive Self-Improvement,RSI)。需要說明的是,這兩篇都還只是 arXiv 預印本,未經嚴格同行評審,卻在社交媒體上收穫了遠超尋常論文的關注。它們憑什麼出圈?
這背後是 AI 發展悄悄換擋的訊號。“遞歸式自我改進”並不新鮮,過去多半停留在模型參數層面,用更多數據、更大算力“喂”同一個模型。而 SwarmWorld 與 ModularRSI 不約而同地把目光從“模型本身”挪開:一個聚焦共享環境,一個聚焦執行機制。這傳遞出一個信號,在模型之外,還有大片等待“進化”的疆土。AI 學會了“製造工具”先看 MIT 那篇。據公開資料,Buehler 是材料科學領域繞不開的名字:MIT 講席教授、土木與環境工程系前系主任。
這一次,他和團隊拋出的 SwarmWorld,沒有堆更大的模型,而是把 50–200 個“初始狀態完全相同”的 LLM 智能體,扔進一個共享的模擬世界。每個智能體都從零開始:沒有預設分工、沒有初始配方、甚至沒有“負責人”,只能觀察、思考、動手——探索地形、採集資源、測試材料、搭建建築、編寫可執行的控制程序。最關鍵的是,這套世界是“物理”的:規則由確定的模擬器執行,智能體可以提出任何設計,但能不能建出來、性能如何,由模擬器說了算。論文想回答的問題是,一群互不相識的 AI,能不能像螞蟻築巢一樣,通過共同的“世界”自發地長出一整套技術?答案出人意料地接近“能”。
在三千多個時間步的模擬裡,智能體自發分化出探索者、建造者、維護者、協調者等角色,技術也在代際間累積、傳承、迭代,甚至出現了相當精妙的結構,比如一種名為“三層連接的幾丁質交換晶格”的構造,經模擬器驗證拿到 0.79 的亮眼評分。SwarmWorld 模擬世界示意圖(A)與智能體“觀察—思考—行動”的執行框架(B)為什麼值得關注?因為 SwarmWorld 從機制上解決了一個老問題:過去讓多個智能體協作,多半靠預設角色、強制分工或中央調度,很難證明“協作本身”創造了價值。它用可控的機制對照實驗,把“聊天”和“共享環境”的作用一層層單獨拆開檢驗。
它也格外“較真”:設置了一個“獨立搜索”的強對照——讓同樣數量的智能體各自為戰,取表現最好的一臺作上限;只有共享世界長出的整體確實強過這臺“尖子生”,才承認協作有價值。尤其值得稱道的是,SwarmWorld 把“認知”和“後果”刻意分開:智能體負責提出設計與假設,但能不能落地、性能如何,由獨立且確定的模擬器裁決,杜絕了“自說自話”。不聊天,反而協作得更好?這裡有個關鍵概念——stigmergy,常譯作“間接協作”或“環境媒介協作”,由法國生物學家 Grassé 於 1959 年提出。它源自昆蟲學:螞蟻並不靠商量,而是通過改變環境,留下信息素、搬運土粒來協調行動。
為了驗證,團隊設計了四組“機制對照”實驗:一組允許完整文化(能聊天、能記錄、能繼承程序),一組去掉聊天,一組連顯式文化也去掉、只留物理環境這一層媒介,還有一組讓智能體各自為戰,作為“獨立搜索”的對照組。結果耐人尋味,共享世界確實長出了更豐富、更抗折騰的“技術組合”。面對從未見過的擾動(汙染、乾旱、風暴),存活韌性普遍更強。但真正讓人意外的是:智能體之間的大部分“複用”,並不靠對話,而是靠觀察環境裡既有的成果。留下來的東西,比說過的話更有用。
研究者也沒有把話說滿:“群體優勢”是有限的,共享世界帶來的是技術生態的多樣化與累積,並不保證每件單體發明都能碾壓個人英雄主義;某些指標上,獨立搜索甚至能造出最強的單件器物。合作的價值在於“讓文明的底子變厚”,而非“讓某一個人更聰明”。從 1959 年“間接協作”概念的提出,到 Boids、蟻群優化,再到 SwarmWorld 的技術脈絡這個發現提醒做 AI 智能體的團隊:與其讓智能體沒完沒了地“開會”,不如給它們一個能共同留下痕跡、共享成果的環境。有開發者直呼這簡直是把“看板”當成了智能體的公共記憶。順著這條線索,SwarmWorld 的“技術傳承”也很有意思。
智能體寫下的可執行程序,不只是自己用,還會成為世界裡看得見摸得著的“遺產”,供後來者觀察、複用甚至改寫。論文稱這種靠實物傳承的積累為“可執行繼承”,它讓知識像滾雪球一樣越滾越大。為了把結論做紮實,團隊跑了兩組互補實驗:一組把智能體規模從 50 拉到 200,看協作優勢如何隨“人口”增長放大;另一組讓 100 個智能體運轉三千多個時間步,不斷用未曾見過的災害打亂局面。當然,也不必過度浪漫化。論文提醒,顯式的“文化”機制(記錄、教學、交易)雖能帶來更強的協作,但並不同時保證每項結果都更優——有時反因環節多了拉低某些指標。協作的紅利有邊界,恰到好處比多多益善更重要。
給 AI 的“執行外殼”動手術如果說 SwarmWorld 關心“一群 AI 如何組織起來”,那麼 ModularRSI 關心的是“一個 AI 的執行機制如何自我完善”。它的作者陣容同樣不簡單:領銜的是曼徹斯特大學與北航的團隊,合作者裡還有瀾舟科技創始人周明——前微軟亞洲研究院副院長、ACL 前主席。先解釋一個概念。大模型要真正幹活,外面還得包一層“執行外殼”(harness),管著推理—行動—觀察的循環、工具調用與上下文取捨。過去兩年,智能體的表現上限,很大程度上取決於這層外殼寫得好不好;而“遞歸式自我改進”,就是讓外殼也能從執行經驗裡慢慢變好。
但這裡有個死結:一次任務成敗是一錘子買賣,它不會告訴你“到底是哪段機制出了問題”,這就是信用分配問題。更麻煩的是,如果直接在評估基準上演化外殼,你根本分不清模型是學到了通用的本事,還是單純“背會了考題”。ModularRSI 的解法可濃縮成六個字:解耦、對比、門控。它先把可演化的外殼拆成五個功能模塊,智能體循環、工具調用、觀測管理、上下文管理、任務完成檢,各自獨立演化;再把每條任務的成敗軌跡分開、成對對比,找出反覆出現的系統性缺陷,對症下藥。
最後,任何改動都要過三道驗證閘門(論文稱 Validation Gates):程序檢查、差異審查(剔除只針對個別任務的過擬合改動)、執行驗證,不達標就回滾。ModularRSI 框架:先做對比軌跡分析,再分模塊演化外殼,最後經驗證門控把關效果相當能打。在 TerminalBench 2.0 上,外殼準確率從 47.57% 提升到 52.43%;在 SWE-Bench Verified 上,從 73.40% 提升到 76.45%。更重要的是,這些提升能跨任務域、跨底層大模型遷移,說明它學到的不是刷分技巧,而是可複用的執行機制。ModularRSI 在兩個主流基準上的性能提升為什麼“通用”這麼難?
細看會發現,不少自我進化方法都鑽了空子:要麼直接拿下游基準的數據演化,等於先看答案再答題;要麼把整套外殼當成一塊鐵板,動一處就牽一髮動全身。ModularRSI 特意劃清界限,用 2000 個與評估基準完全不相交的任務來“練功”,堅持分模塊小步快跑。這種較真,換來的是實打實的跨模型遷移能力。研究者還做了一組對照:把五個模塊揉在一起整體演化,與分開演化再合併相比,後者明顯勝出。這說明,把複雜問題拆成邊界清晰的子問題逐個擊破,即便在“讓 AI 改進自己”這件事上依然成立。
細看這五個模塊,會發現它們幾乎對應著智能體幹活時的全部“軟技能”:智能體循環掌管推理與行動節奏,工具調用決定何時出手,觀測管理篩出反饋要點,上下文管理取捨歷史記憶,任務完成檢測則盤問“活幹完沒有”。這種“器官分工”,讓每次改進都能精準定位,而不是一刀切地重寫全局。同一條路上,兩種走法把兩篇論文擺在一起看,它們共享同一個雄心:讓 AI 從自己的經驗裡變得更強,也都不相信“在基準上刷分”能帶來真本事。但走到岔路口,它們分道揚鑣了。SwarmWorld 往“群體”走:把幾十上百個智能體放進共同的世界,讓分工、協作、技術傳承從環境與積累中自發湧現。它的槓桿,是共享的“物理世界”和持久化的成果。
ModularRSI 往“個體”走:把單個智能體的執行機制拆成零件逐個打磨。它的槓桿,是模塊化結構、對比學習的信用分配和嚴格的驗證閘門。一句話概括:一個是“讓文明的底子變厚”,一個是“讓工匠的手藝變精”;一個面向科學發現,一個面向軟件工程。“AI 自我進化”的兩種路線定位兩篇論文也都對“評估”保持了警惕:SwarmWorld 用“未見過的擾動”考驗技術,ModularRSI 用與基準完全不相交的數據逼自己學“真本事”。這種對泛化的執著,或許最值得尊重。
從團隊構成也能看出分野:SwarmWorld 出自 MIT 的材料科學實驗室,帶著“科學發現”氣質;ModularRSI 是一支橫跨高校與產業界的 NLP 團隊,奔著“讓智能體真正好用”而去。一條往科學的天花板夠,一條往工程的落地處扎。當 AI 開始改進自己,意味著什麼這兩篇論文最引人遐想之處,在於它們共同指向一個更大的命題:當 AI 能自己創造思考的空間、改進自己的機制,所謂的“智能爆炸”,也許就不再只是科幻設定。
Buehler 在那條題為 Recursive Meta-Intelligence 的長文裡寫得很直白:AI 為科學打開了一扇門,能發明我們沒時間親手去造的新儀器,遍歷我們無力窮盡的可能未來,再把海量探索壓縮成幾條人能理解、能驗證、能製造的機制原理。他管這叫“擴展人類認識的邊界”。(這條長文是 SwarmWorld 的姊妹篇。)而 ModularRSI 的團隊則更務實,把代碼開源到了 GitHub。當然,也要潑一盆冷水。這兩篇都還只是預印本,實驗規模與泛化結論還需更大範圍、更長時間的檢驗。SwarmWorld 目前仍完全運行在模擬器裡,要遷移到真實的機器人世界還有一段路走。
正如一位評論者在 DAIR.AI 推文下的留言一針見血——“很難分辨,這層外殼是不是隻是把失敗模式,挪了個地方。”回看這兩篇論文,會發現它們的野心互為表裡:SwarmWorld 想證明“集體智慧可以自下而上地湧現”,ModularRSI 想證明“個體能力可以自上而下地精進”。一個把舞臺交給環境與群體,一個把功夫下在機制與細節。它們未必是最終的答案,卻共同指向了一個更有想象力的未來——AI 能在一個不斷累積的世界裡,自己動手、自己傳承、自己進化。但無論如何,方向已經清晰:AI 的下一個躍遷,可能不再取決於把模型做得更大,而在於讓它學會在經驗中自我打磨、在群體中相互成就。
從“用更大的模型”,到“用更好的自己”——這或許是未來幾年最值得期待的一躍。(本文首發APP,作者 | 硅谷Tech-news,編輯 | 焦燕)參考資料:https://x.com/dair_ai/status/2101835306953736396https://x.com/ProfBuehlerMIT/status/2099834306046664792https://arxiv.org/abs/2608.26081https://arxiv.org/abs/2609.14857
Related
相關文章

滴滴自動駕駛連獲全國工商聯及北京市榮譽榜單認可
滴滴自動駕駛首次入選2026年民營企業發展新質生產力案例,並登上北京民營企業未來產業先鋒榜。滴滴在民營企業研發投入榜單中名列第25位,北京民營企業百強第7位。滴滴自動駕駛已累計安全運行超過2200天,並與廣汽埃安合作推出新一代Robotaxi車型,開啟無人載客服務。
世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管
報告指出,雖然人工智能正在以前所未有的速度重塑健康研究、加速科學發現並改善醫療成果,但在缺乏強有力的倫理防線與監管 oversight 的情況下,AI 醫療研究也可能引入新的風險,從而危及人權、社會公平以及公眾信任。在現有的倫理審查機制方面,世衛組織警告稱,傳統的審查體系往往難以應對人工智能帶來的新型風險,包括算法透明度、偏見、公平性、問責制、隱私保護,以及快速部署 AI 工具可能引發的潛在危害。
Grok Bot 上線僅一個月,周活躍用戶數正式突破 40 萬大關
根據最新行業報道顯示,由馬斯克的 SpaceX AI 團隊推出的 Grok Bot 人工智能智能體在上線大約一個月後,其周活躍用戶數已經成功突破40萬大關。具體數據表現十分亮眼。截至9月14日的統計數據顯示,Grok Bot 的用戶規模已迅速攀升至41.
蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你;高德地圖成「職場版大眾點評」?回應來了;Muse大火,扎克伯格身價暴漲1700億
要聞提示1.蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你2.知情人士:DeepSeek將向聯合國安理會介紹AI風險,月之暗面等中國企業也受邀參會3.高德地圖成“職場版大眾點評”?回應來了4.字節通報二季度違規案例:114名員工被辭退,其中8人被移交司法機關處理5.

消息稱 DeepSeek 本週參加聯合國安理會,講解 AI 安全風險
作者:潞源 責編:潞源 評論: 感謝網友 咩咩洋、軟媒用戶1238620、西窗、HH_KK 的線索投遞!9 月 22 日消息,據路透社今日援引知情人士消息,中國人工智能初創公司 DeepSeek(深度求索)將在本週參加聯合國安理會,講解 AI 安全風險。

講真,我沒看出這圖是AI做的,更沒想到是國產AI做的
答案是,都是AI。即便我們把圖片放大,似乎也是找不到以前那種“一眼AI”的細節: 而且啊,這兩張圖片並非出自你以為的Image 2.5之手,實則是來自一個國產AI—— 正是我們之前稱之為“今年WAIC最驚豔的圖”背後的模型,來自商湯科技的SenseNova U1 Pro(下文簡稱U1 Pro)。