閉源RSI的嚴父:18個Agent自主科研,Kimi K3靠Harness逼近Opus 5

在人工智慧研究領域,遞歸自我改進(RSI)向來被視為通往通用智慧的關鍵路徑,而過去這條路徑多半與開放原始碼社群協作、持續回饋循環緊密連結。然而,近期一股名為「閉源RSI」的新路線正以截然不同的姿態登場,打破外界對模型自我進化的既有想像。這套方法不再仰賴外界眾包,而是轉向內部高度控制的封閉體系,試圖在完全可控的環境下推動跨越式進展;其操作風格甚至被形容為「嚴父」式的強硬主導,強調紀律化管理與精準調度。這條新路線的具體實現,是讓 18 個具備獨立研究能力的 Agent 投入自主科研流程。
這些 Agent 不再只是人類研究員的輔助工具,而是被賦予從提出假設、設計實驗到分析結果的完整任務,幾乎形成一支自動運轉的微型研究團隊。值得注意的是,整個過程始終維持閉源狀態,由開發方以嚴格的規範約束每個環節,避免傳統開放式反饋可能帶來的雜訊與方向偏移。這種做法捨棄了過去依賴社群逐步疊代的安全網,轉而追求在封閉場域內最大化效率與收斂速度。支撐這套體系的關鍵,則是一個名為 Harness 的框架。它像是一道總控閘門,將 Agent 的研究行為、資源調度與決策路徑悉數納入統一編排,確保所有步驟都沿著預設目標加速收斂。
Harness 不僅負責協調 18 個 Agent 之間的任務分配,還能動態調整實驗參數、監控研究進度,並在必要時介入糾偏。這種「中央集權」式的管理,恰恰與開源 RSI 的分散式協作形成鮮明對比;前者強調紀律與效率,後者則重視多樣性與意外發現。在 Harness 的調度下,Kimi K3 的表現也確實逼近了外界熟悉的 Opus 5 水準。Opus 5 是當前業界公認的頂級模型之一,其能力門檻極高,而 Kimi K3 能夠在封閉環境中自主推進研究,並以驚人效率逼近此一標竿,無疑驗證了閉源 RSI 的可行性。
這個結果不僅讓原本被視為「唯一出路」的經典劇本顯得不再那麼理所當然,更引發業界對「何謂有效改進路徑」的重新思考。過去,許多人相信只有透過開源社群的廣泛參與,才能累積足夠的數據與反饋來驅動模型持續進步;但閉源 RSI 的實踐證明,少數精心設計的 Agent 在高度控制的環境中,同樣能產出接近頂尖水準的成果。這背後的邏輯在於:當研究目標明確、流程標準化時,封閉系統反而能避免因外部雜訊導致的資源浪費,讓每一輪迭代都精準對齊最終目標。當然,這條路線也引發了若干爭議。
批評者認為,閉源 RSI 可能導致技術壟斷加劇,因為開發方能夠完全掌握模型的進化軌跡,而不需與外界分享中間成果;支持者則指出,這種方法更適合需要快速迭代、保護商業機密的場景,尤其對於那些希望將核心能力鎖定在內部的企業而言,閉源 RSI 幾乎是必然選擇。值得注意的是,閉源 RSI 的 Agent 並非憑空產出突破,而是依賴 Harness 框架提供的嚴謹實驗設計與資源調度。這意味著,真正決定效果上限的,或許不是 Agent 的數量或算力規模,而是框架本身的設計品質。Harness 能否在未來進一步擴展,容納更多 Agent 同時運作,或是在不同領域的任務中展現通用性,將是後續觀察的重點。
從經典的開源 RSI 到如今的閉源路線,人工智慧領域的自我改進正從「眾志成城」走向「精兵強將」。18 個 Agent 在封閉環境中自主科研,並以 Kimi K3 逼近 Opus 5 的成績,已經為這個命題提供了具體的實驗證據。未來,這兩種路線是否會走向融合,或者各自在不同場景中發揮優勢,仍有待時間驗證。但可以確定的是,閉源 RSI 的出現,已經讓整個領域對「何謂有效改進路徑」的認知,開始重新校準。
Related
相關文章

消息稱 NVIDIA 考慮向 Perplexity AI 投資“數十億美元”
作者:溯波(實習) 責編:溯波 評論: 8 月 24 日消息,外媒 The Information 稍早前報道稱,NVIDIA(英偉達)考慮在 Perplexity AI 的最新融資輪中向這家人工智能初創企業投資“數十億美元”。雙方正就該交易展開磋商,還可能達成技術授權協議。

Rabbit做了個“所有Agents的Agent” ,體驗後我覺得Agent早就該長它這樣
Rabbit推出了一個被稱為「所有Agents的Agent」的新產品,實際體驗後讓人覺得Agent早就該長這樣。文章認為Agent普及的關鍵並非增加更多能力,而是讓用戶少理解十個概念,降低使用門檻。
Guidelight評估五大AI實驗室,OpenAI遏制能力排名第一
該評估覆蓋Anthropic、Google、OpenAI、Meta和xAI,僅依據公開信息考察其是否建立監控、異常行為處置、第三方審計及失控模型關閉等機制。在滿分5分的評估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。
τ_0-VLA長程操控
τ₀-VLA是一種層次化機器人基礎模型,透過世界模型引導的測試時計算來改善長程操控任務。高層策略在決策不確定時會額外分配計算資源,搜尋替代子任務並預測其視覺結果,而低層策略則在40,115小時的異質真實世界數據上訓練。在包含13到25個步驟的真實長程任務中,封閉迴路成功率從27.5%提升至45.0%。