量子位AI Agent

中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷

2026年8月8日 16:02
中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷

重點摘要

由盛大集團孵化的EverMind團隊連續發表三篇論文,針對AI長期記憶與自我進化問題提出完整技術棧方案,涵蓋腳手架、技能庫與模型權重三個層面的自改進機制。此舉在海外NeoLab團隊仍處於單點探索階段時,率先交出全棧自進化AI的首份答案。

站內 AI 整理稿

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷 Jay 2026-08-08 15:56:09 來源:量子位 海外團隊紛紛下注,NeoLab浪潮狂飆 允中 發自 凹非寺 量子位 | 公眾號 QbitAI 2026年夏天,註定是自進化AI的歷史一刻。

當海外NeoLab還忙於靠敘事拿下數億美元融資時,一家中國團隊用連續三篇論文,交出了自進化AI領域第一份全棧答案。它就是EverMind,由盛大集團孵化,延襲當年創新院研究基因。其實回顧中國互聯網史,盛大創新院的存在幾乎算得上「異類」。2008年,陳天橋在盛大集團內部創立該機構,其定位不是做產品、也不追KPI,就是純粹地探索技術前沿。這在那個流量為王、變現至上的互聯網時代,其實是一種極為罕見的企業內研究文化。彼時,這種模式在中國企業界幾乎是開創性的。十餘年後,時代的底色已經從互聯網切換到了AI。

而盛大集團的戰略佈局,也已經集中到更為前沿的腦科學和人工智能方向—— 近三年來,盛大All in AI,在原有風險投資體系基礎上,通過內部孵化機制在全球範圍內廣泛吸引頂尖AI人才,陸續孵化出多支專注於不同AI方向的研究型團隊。EverMind,正是其中一支。如果說盛大創新院開創了中國企業內研究型組織的先河,那麼EverMind的出現,則是這一基因在AI時代的延續與昇華。也正因如此,這支團隊從一開始便選擇了一條在商業上看似“最難”、在技術上卻“最根本”的路: 解決AI的長期記憶問題,並在此基礎上,探索AI的自進化之路。

放至2026年的AI版圖上,這個模式有了一個更為響亮的名字——NeoLab(新一代AI實驗室)。海外團隊紛紛下注,NeoLab浪潮狂飆 NeoLab這個詞,最早是被用來描述那批從OpenAI、Google DeepMind、Meta等頂級AI機構出走、押注前沿技術方向獨立創業的研究型團隊。他們的共同特徵是:面向下一代AI技術、研究驅動和長期主義。2026年,這股浪潮已經洶湧到了無法忽視的程度: 比如,前Salesforce首席科學家Richard Socher與前Meta FAIR科學家總監田淵棟聯合創立的Recursive Superintelligence(RSI)。

其在團隊不足30人、尚無任何產品的情況下,拿到了6.5億美元融資,估值高達46.5億美元,並隨即與AWS簽署了4.1億美元的多年算力合作協議。DeepMind的AlphaGo之父David Silver帶著Ineffable Intelligence以51億美元估值殺入戰局。Engram以6億美元估值完成了9800萬美元A輪融資,Adaption Labs以10億美元估值拿到了5000萬美元種子輪,Core Automation的估值目標直指40億美元…… 這些團隊押注的核心命題,都指向同一個方向:如何讓AI在部署後不再是一成不變的靜物,而是能夠通過自我迭代實現持續進化。

這個方向,在學術上被稱為遞歸自我改進(Recursive Self-Improvement),在產業上被稱為自進化AI(Self-Evolving AI)。然而,當我們仔細審視這些估值驚人的NeoLab時,會發現他們大多仍停留在單點突破的理論探索階段: RSI:初步分享了先進的理念和路線設計,但尚未公佈具體方案或成果; Engram:專注於參數化權重記憶,但缺乏腳手架層的靈活進化機制; Adaption Labs:主攻推理時適應,但沒有長期技能沉澱體系; Core Automation:方向最為接近,但也還沒有公開的論文和開源生態。

就在海外團隊還在各自的細分領域摸索時,EverMind悄然完成了一件令人矚目的事: 連續發佈三篇重量級論文,從技能層、腳手架層到模型權重層,系統性地給出了一套完整的自進化AI技術答案。一次對話,兩個入口:當RSI遇上EverMind 在深入這三篇論文之前,有一個細節值得單獨記錄。今年四月,EverMind主辦了一場名為“記憶起源”(Memory Origins)的Hackathon活動。在這場活動上,出現了一位特別的嘉賓——Recursive Superintelligence(RSI)的聯合創始人之一,田淵棟。

田淵棟在活動上分享了他對AI記憶工作的深度理解,而彼時RSI融資的相關進展尚未披露。在活動結束後,田淵棟與EverMind負責人鄧亞峰共同接受了「硅谷創見匯」播客的採訪,兩人就AI行業的發展走向和記憶相關技術的前景進行了深入對談。在這次對話中,鄧亞峰提出了一個核心判斷,也透露了EverMind技術戰略的脈絡: 從長期記憶,結合持續學習,走向自我進化是下一代AI的核心技術路線。這句話值得細細品味。記憶,是Agent積累經驗的載體;自進化,是把經驗轉化為能力躍升的路徑。沒有高質量的記憶,自進化就是無源之水;沒有自進化作為目標,記憶就只是一個越來越大的檔案館。

EverMind從EverOS(記憶操作系統)到Raven(自進化Agent框架),再到三篇自進化論文所構建的完整技術棧,正是這一判斷的系統性實踐。田淵棟與鄧亞峰在同一個舞臺上的相遇,某種程度上也是一個隱喻: 當海外最頂尖的自進化研究者,與中國最具研究深度的記憶AI團隊相遇,他們發現彼此正在從不同的入口,攀登同一座山峰。為什麼「自進化」重要且難?在深入EverMind的技術細節之前,還需想清楚一件事:為什麼“讓AI自我進化”既是必答題,又是一道難題。傳統大語言模型一旦完成訓練並部署,能力就被凍結了,不再隨使用而增長。可人類智能最迷人的地方恰恰相反——每一次交流、每一次思考,我們都在悄然進化。

下一代AI也理應如此:能夠通過持續學習不斷變得更聰明,而不是停在出廠那一刻。而且這條路正在變得現實。隨著大模型能力的躍升,越來越多的案例表明,“AI自主改進AI”已經從設想走向可行,在某些環節甚至開始超越人類專家。一旦AI能夠穩定地自我改進,隨之而來的很可能是一場生產力的躍遷。但要真正做到這一點並不容易。業界通常有三條路徑,每一條都橫著一道難關。腳手架(Harness)的自我改進,是第一道關卡。一個Agent的實際表現,不僅取決於模型本身,更取決於包裹在模型外圍的「腳手架」——提示詞、注入的知識、運行時控制邏輯等。

讓模型自己修改這些代碼看似簡單,真正的難點卻在於如何避免過擬合:模型自我生成的反饋往往充滿噪聲,一個看似有效的修改,可能只是針對特定測試集的過擬合,換個場景就會導致災難性崩潰。技能(Skills)的規模化管理,是第二道關卡。當Agent把成功經驗固化為可複用的技能文件,技能數量會爆炸式增長,那麼如何管理這些碎片化、冗餘、質量參差不齊的技能?又如何在一個數十萬量級的技能庫中,精準檢索出當前任務真正需要的那幾個?這類工程問題長期被學術界忽視,卻恰恰是產品能否落地的關鍵。模型權重(Weights)的訓練信號分配,是第三道關卡。

在最底層的模型訓練階段,同策略自我蒸餾(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。但傳統OPSD在處理長序列推理時,會把相同的監督權重均勻分配給每一個生成步驟,完全忽略了錯誤發生的時序上下文。這就像長跑時,無論你在起跑摔倒還是在終點前摔倒,教練的懲罰都一模一樣。如此粗顆粒度的信號分配,嚴重拖累了模型的學習效率。EverMind的三篇論文,正是分別瞄準這三道難關,各自給出了嚴謹的解法。HarnessBank:讓Agent學會安全改寫「腳手架」 在實際部署中,模型權重往往是凍結的,修改Agent外圍的Harness成為了提升性能的最直接手段。

EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架: 它能夠讓Agent自主診斷失敗並重寫自己的運行邏輯,同時從根本上解決了自我改進中的過擬合問題。這套框架的核心創新在於將“提出變更”與“歸因變更”徹底分離。在過去的研究中,模型既當運動員又當裁判,自己寫代碼自己評估,極易產生幻覺式的性能提升。

而在EverMind的方案中,語言模型只負責診斷失敗原因並提出補丁(Patch),所有的採樣、測量和顯著性檢驗全部交由確定性的代碼邏輯來控制。這一設計確保了每一個被系統認可的性能提升,在統計意義上都是絕對可靠的,而非測量誤差或隨機波動。更有創新性的是其引入的裝備基因庫(Harness Gene Bank, HGB)機制。傳統的自進化系統往往以“任務”為鍵(Key)來存儲改進,這極易導致系統只學會瞭如何解決特定的幾道題,換一個場景便原形畢露。

EverMind則將每一份高性能腳手架以“WHERE × WHY”(改動作用在哪個環節、又是為何被引入)作為語義座標存檔,並支持通過故障診斷進行“重新發明”,或跨單元進行“機制重組”,防止搜索過程陷入崩潰或原地打轉。這種設計引入了強大的抗過擬合歸納偏置——系統學到的不是“如何解決這道題”,而是“如何修復這類病理”。為了從大量候選後代腳手架中高效挑出真正有效的改進,團隊還設計了分級裝備篩選(Gated Harness Screening)機制,用有效性、激活、配對顯著性、增益四道順序閘門層層過濾,兼顧了評估成本與結果的可信度。實驗結果證明了這一設計的有效性。團隊默認以Qwen3.

6-27B作為任務Agent、Claude Opus 4.8作為進化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七個多樣化基準上評測,並與GEPA、DGM(Darwin Gödel Machine)兩種當前最先進的自進化方法對比。結果顯示,在凍結任務Agent權重的情況下,HarnessBank在全部七個基準上取得了5.1%到15.4%的一致性能提升。同時所有增益均通過了配對顯著性檢驗(z≥1.96),證明這些提升在統計意義上絕對可靠,而非測量誤差或隨機波動。

論文中還有一個極具啟發性的發現: 跨模型實驗證實,這些性能提升來自模型特異性的自進化過程,而不是存在某個放之四海而皆準的“萬能腳手架”。獲勝的補丁追蹤的是模型的主導“病理”,而不是模型的大小或家族。也就是說,當你更換一個不同的基礎模型時,主導病理會改變,對應的最優腳手架也會隨之改變;但同樣的病理-補丁匹配關係,會在不同的模型家族中重複出現。這意味著,EverMind構建的這套“診斷-歸因”循環機制,是一種可以跨模型遷移的元能力,證明了AI for AI的技術可行性。

SkillCorpus:10萬技能庫背後的工程與科學 如果說Harness的自進化賦予了Agent重寫邏輯的能力,那麼“技能”(Skills)則是Agent沉澱經驗的具體載體。在EverMind的Raven框架中,內置了高達10萬項開箱即用的技能。這並非簡單的數量堆砌,其背後的工程與科學支撐,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。隨著開源社區中技能文件(如Skill.

md格式)的爆發式增長,這些資產呈現出嚴重的碎片化、冗餘和質量不均。EverMind團隊構建了一個名為SkillCorpus的框架,首次在規模化層面上對開放技能生態進行了聚合、策展、匹配和評估。這個過程堪稱一場浩大的數字淘金。團隊從爬取的大約82.1萬個原始技能中,通過多階段多維度策略過濾,最終精選出96401個高質量技能。為了管理這些技能,他們建立了一個包含16個類別的分類法,並從實用性(Utility)、魯棒性(Robustness)和安全性(Safety)三個維度進行了嚴格的質量控制。僅僅有庫還不夠,關鍵在於檢索。

EverMind配合這個龐大的語料庫,微調了一套專門的檢索與選擇技術棧,確保Agent在執行任務時能夠精準匹配到相關的技能。SkillsBench、GDPVal和QwenClawBench三個基準測試中的端到端評估顯示,自研的Raven Harness集成SkillCorpus後,Agent在所有基準上均獲得了穩定的性能提升,其中在SkillsBench上的提升最大,達到了7.5個百分點。

通過深入的運營分析,團隊還識別出了技能帶來的增益邊界—— 覆蓋邊界(技能庫是否覆蓋了任務所需的知識)和Harness邊界(Agent的腳手架是否能有效調用技能),這為未來如何進一步優化技能檢索和應用指明瞭方向。這篇論文不僅是對Raven 10萬技能庫的技術解密,更是業界首個關於“經過策展和檢索服務的社區技能庫如何在真實Agent任務中發揮作用”的端到端系統性研究。更進一步,技能並非一入庫就固定不變。無論是人工編寫的技能,還是AI自動生成的技能,EverOS都能依據任務執行的成敗經驗對其持續打磨。用得好的被強化、被複用,用得差的被修正、被淘汰。

技能庫因此不是一份靜態清單,而是一個隨任務不斷自我進化、越用越強的資產,這也正是技能沉澱歸屬於任務層的原因所在。DASH:讓模型看清哪裡出了錯 自進化的最深層,是模型權重的自我迭代。EverMind的最新論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(https://arxiv.org/pdf/2608.06243v1),展示了其在底層算法上的深厚功底。

傳統的同策略自我蒸餾(OPSD)存在一個致命的時間盲區: 它對所有局部散度(即學生與教師的差異)分配相同的係數,完全忽略了錯誤發生的時間順序和上下文。EverMind的研究團隊通過對大量真實推理軌跡的分析,發現了一個關鍵現象:在一個推理序列中,局部散度值的大小與未來散度的演變之間,存在極弱的關聯。這意味著,用同一個係數來處理所有時間步的散度,本質上是在用一把尺子量所有不同形狀的錯誤,必然導致監督信號的嚴重失真。為了解決這一問題,EverMind提出了DASH(Divergence-Adaptive Supervision Horizons)。

DASH的核心思想是將每個局部蒸餾信號與序列級均值之間的差距,轉化為一個自適應的傳播門(Propagation Gate),然後利用這些門控制向後的多步聚合。當一個時間步的局部散度高於序列均值時,說明這裡是一個高風險分叉點,DASH會打開一個更大的傳播門,讓這個時間步的監督信號向前傳播更遠;反之,傳播門收窄,避免無關緊要的步驟干擾整體學習。實驗結果令人印象深刻。在AIME 2024、AIME 2025和HMMT 2025三個極具挑戰性的數學推理基準上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三個模型規模上均取得了所有對比方法中的最高分。在Qwen3-1.

7B上,DASH將三個基準的平均得分從vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,從65.00提升至66.40。更重要的是,DASH不需要引入任何額外的教師或學生前向傳遞開銷,這意味著這種性能提升幾乎是免費的。EverMind的自進化框架全景 在長期記憶領域已經貢獻了數篇ACL、KDD等頂會高質量論文,並取得開源庫1.8萬star後,EverMind繼續分享對自進化演進的研究成果—— 將自進化的完整路徑,概括為一個從任務層到元改進層的四層遞進體系。

上述三篇論文構成的技術棧,與EverMind內部的產品和研究框架之間,存在著精密的映射關係: 1、任務層: 任務層是最直接的進化層次,進化在單次任務中即時發生。優化對象是單次任務的執行質量,既包括記憶的提取與回寫,也包括技能(Skills)的即時沉澱與複用;經驗來源是 Context、Trace 與用戶反饋,更新動作是即時回寫,驗證方式是結果與反饋。這一層的能力複利是“記得更牢、用得更順、單次任務做得更好”,價值定位是沉澱任務級、可複用的記憶與技能資產。這正是EverOS與SkillCorpus所覆蓋的核心場景。

2、腳手架層: 腳手架層(Harness)優化對象是Code與Policy,即Agent外圍的運行邏輯與控制策略;經驗來源是Eval與Reflection,更新動作是腳手架的版本迭代,驗證方式是Agent Evals覆盤。這一層的能力複利是“更會執行”,價值定位是可複用行為資產的持續積累。這正是Raven框架與Self-Evolving Harness論文所對應的工作。3、模型層: 模型層優化對象是模型本身,經驗來源是高價值軌跡、偏好與失敗樣本,更新動作是LoRA與端側模型的驗證後灰度,驗證方式是離線集加灰度測試。這一層的能力複利是“更準、更省”,價值定位是個性化的專屬模型能力。

DASH論文正是這一層的核心算法支撐。4、元改進層: 元改進層是整個框架最令人興奮的頂層。優化對象是Evaluator、Data與Training Recipe本身,經驗來源是多輪實驗與Benchmark,更新動作是優化“提出—選擇—驗證”的整個循環,驗證方式是版本門檻加評測體系。這一層的能力複利是“下一輪進化更快、更可靠”,價值定位是讓改進能力本身也持續升級。這個四層框架的深刻之處在於,它把自進化拆成了四個層層遞進又彼此支撐的環節,併為每一層都配備了具體的技術路徑與驗證機制。它不是一張空洞的願景圖,而是一個有工程細節、有學術支撐的完整路線圖。

其實在今年4月,團隊就率先提出了針對Agent自進化的評測基準EvoAgentBench,當月在Hugging Face同類benchmark上下載量第一。這是一套用於衡量智能體從既往執行中提取並遷移能力效果的評測方法,為技能沉澱、腳手架迭代和模型優化提供統一、可比較的驗證框架。結合三篇論文從技術、腳手架到模型權重的系統性探索,EverMind已將自進化能力建設由方法研究延伸至評測體系,形成更完整的技術閉環。對比海外座標系,EverMind走到了哪一步?要理解EverMind這套完整技術棧的領先性,我們不妨將目光投向海外那些估值令人咋舌的NeoLab。

Recursive Superintelligence(RSI)提出了宏大的“自動化AI研究閉環”理念,並拿到了6.5億美元融資和AWS的4.1億美元算力合作協議。其第一階段目標是訓練一個具備“5萬名博士”能力的系統來自動化AI科學研究本身。然而,RSI目前仍處於純研發階段,尚無成型的產品或框架落地,其公開結果僅限於在GPU內核算法優化基準上超越了人類兩年的優化記錄。Engram以6億美元估值完成了9800萬美元A輪融資,其核心技術是基於稀疏記憶模塊的參數化權重記憶(如LoRA微調)。

Engram在降低推理成本和解決災難性遺忘方面做出了出色工作,但其路徑過於依賴底層權重的更新,缺乏在Agent腳手架(Harness)和外部技能庫層面的靈活進化機制,且需要白盒訪問模型權重,這在實際部署中是一個重大限制。Adaption Labs(估值10億美元)主攻無梯度推理時適應,試圖通過動態解碼和適配器組合來消除微調和提示詞工程。這在思路上與EverMind的Harness自進化有相似之處,但Adaption Labs缺乏如SkillCorpus這樣龐大且經過策展的外部經驗沉澱體系,也沒有在底層訓練算法上進行深度優化。

Core Automation(估值目標40億美元)由前OpenAI研究副總裁Jerry Tworek創立,其旗艦項目Ceres專注於持續學習模型,目標是將訓練數據需求降低100倍。這是與EverMind方向最為接近的項目,但Core Automation目前仍在早期研發階段,缺乏EverMind這樣完整的技術棧和開源生態。相比之下,EverMind的獨特之處在於其“三層併發”的戰略縱深。它沒有陷入「參數化記憶」與「非參數化記憶」的非此即彼的爭論,而是通過EverOS(非參數化長期記憶)、Raven(Harness自進化)和DASH(底層權重訓練優化)構建了一個全棧生態。

更重要的是,EverMind堅持開源優先,通過在GitHub上積累的超過1.2萬顆Star(同期mem0為7千),正在迅速建立起類似Android的底層開發者生態護城河。屬於中國NeoLab的時刻到了 再往前,EverMind團隊相信: 下一代AI,必然是一個能記住用戶偏好、越用越聰明的AI。以長期記憶累積經驗,以持續學習改進模型,真正走向AI的全棧自我進化,將是這一代AI最重要的技術路線。這條路線一旦被打通,無論是數字世界裡的Agent、物理世界中的具身機器人,還是整個AI for Science領域,都將被深刻改變。

在互聯網時代,盛大創新院曾是中國企業內研究文化的先行者,被後來的互聯網及各領域巨頭紛紛效仿;在AI時代,EverMind也正在成為中國NeoLab浪潮中最具研究深度的代表之一。僅僅一年間,團隊就在長期記憶與自進化領域產出9篇高質量論文,其中數篇被ACL、KDD等頂會錄用。這意味著EverMind的自進化不只是一個工程化產品,更有紮實的底層技術與嚴謹的學術支撐: DASH讓模型在訓練時“看清自己錯在哪裡”,Self-Evolving Harness讓Agent在運行時安全地重寫自身邏輯,SkillCorpus讓Agent的成功經驗被規模化地沉澱與複用。

三者合一,構成了一個從「感知錯誤」到「修改邏輯」再到「沉澱記憶」的完整自進化閉環。但這條路,EverMind並不想獨自走完,團隊誠摯邀請各領域的夥伴與之同行,一起共同構建AI長期記憶的基礎設施,把持續學習與自我進化推向科學、具身、金融、智能硬件等更廣闊的場景。在定義「數字生命」下一個形態的道路上,中國的研究型團隊,已經來了。至於更精彩的部分,才剛剛開始。HarnessBank論文鏈接:https://arxiv.org/abs/2607.13683 SkillCorpus論文鏈接:https://arxiv.org/abs/2607.15557 DASH論文鏈接:https://arxiv.

org/pdf/2608.06243v1 版權所有,未經授權不得以任何形式轉載及使用,違者必究。EverMind Jay 奧特曼的ChatGPT育兒大法,捅了馬蜂窩2026-08-08 都學壞了!奧特曼親手封鎖最強模型Astra,重蹈Mythos覆轍2026-08-08 剛剛,ChatGPT免費版史詩升級!GPT-5.6可以無限白嫖了2026-08-07 沒有人靠段子永載GitHub,除非谷歌姐夫2026-08-06 掃碼分享至朋友圈

Related

相關文章

量子位AI Agent

谷歌急了:AI核心員工全給我搬回硅谷坐班!

谷歌為加速AI開發,強制將分散在倫敦與硅谷的核心AI人員全數調回加州總部集中辦公,以消除時差問題。此外,該公司正洽談以超過15億美元收購初創公司Mechanize,藉此取得現成的AI編程團隊與技術。

12 分鐘前
何夕2077AI Agent

編碼智能體自進化

編碼智能體自進化。 編碼智能體新系統上線。它主打自改進策略實現長程自治。項目在智能體自進化(AI資訊)獲 (6.4k) 贊。今日新增超兩千顆星 ��� 熱度飆升。程序員的日常工作流從此迎來變革。

11 小時前
何夕2077AI Agent

多代理協同管理工具

多代理協同管理工具。 協同工具開源項目面向大眾。多智能體協作 ��� 痛點在這裡被解決。項目在多智能體協同管理工具獲 (1.8k) 贊。任務調度邏輯不再需要複雜的純手工。團隊協作效率在工具加持下成倍增加。

11 小時前

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

13 小時前

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

13 小時前
鈦媒體AI Agent

騰訊是在“賽馬”,還是在打造 “Agent工廠”?

騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。

16 小時前