人大高瓴、IQuest團隊聯手,把OpenClaw、Claude Code接進RL訓練中
作者 | 陳駿達 編輯 | 心緣 8月18日報道,昨天,中國人民大學高瓴人工智能學院、至知創新研究院團隊聯合提出了一個面向複雜Agent Harness的黑盒強化學習框架ClawGym II。ClawGym的長期願景,是構建一套面向General Agent持續訓練、能力演進與可靠評測的完整基礎設施,推動Agent從依賴外部強模型和離線數據,逐步走向能夠在真實交互環境中持續學習和提升。在Part I中,團隊圍繞這一目標,率先打通了從高質量任務合成、真實Agent交互軌跡收集,到模型訓練與系統化評測的完整鏈路,並驗證了利用真實Agent系統產生的交互數據訓練專用模型、提升Agent能力的可行性。
相關工作已開源在:https://github.com/ClawGym。在此基礎上,ClawGym II進一步將真實Agent Harness直接納入強化學習閉環:無需改動Claude Code、OpenClaw等Harness的內部實現,即可讓模型通過其真實執行過程進行強化學習,並支持多個異構Harness聯合訓練同一個策略模型。實驗顯示,通過OpenClaw和Claude Code進行黑盒RL均能穩定提升模型的Agent任務能力;進一步將不同Harness產生的rollout納入統一訓練後,一個共享策略模型也能夠同時從多個異構Harness中學習。論文鏈接:https://arxiv.
org/abs/2608.16798。一、更強的Harness,模型未必會用 Agent Harness已成為現代智能體系統的執行基礎。它把系統提示、工具接口、上下文管理、工作流和錯誤恢復等機制整合在一起,讓模型能夠在複雜環境中持續交互、完成長程任務。Claude Code、Codex、OpenClaw等系統的發展也表明,Harness正在成為影響Agent能力的重要因素。但更強的Harness並不意味著模型能自然用好這些能力——面對更復雜的工具、交互協議和執行機制,模型仍要學習如何規劃、決策並與環境交互。
ClawGym II延續了ClawGym圍繞真實Agent系統訓練模型的研究路線,但進一步把問題從“利用Harness產生的交互數據訓練模型”,推進到“直接通過Harness進行強化學習”。它試圖回答一個更進一步的問題:能否直接通過真實、複雜的Agent Harness持續優化模型本身?對於Claude Code、OpenClaw這類複雜系統,其內部控制流和執行邏輯對訓練系統不可見,團隊將這一設定稱為黑盒強化學習(Black-box RL):Harness保持原有執行邏輯不變,訓練系統只基於其產生的交互軌跡優化底層策略模型。直接通過複雜黑盒Harness做強化學習,首先要過三道坎。
第一道是可擴展且穩定的執行基礎設施:通用Agent任務依賴獨立且有狀態的運行環境,大規模併發rollout與長程交互中的延遲、異常和失敗,都可能影響訓練穩定性。第二道是從碎片化黑盒軌跡中進行有效優化:黑盒Harness暴露給訓練系統的只是分散、分叉甚至冗餘的模型調用,完整的多輪訓練軌跡並不可見,Harness內部的消息處理還可能進一步帶來訓練-推理不一致。第三道是跨異構Harness的可擴展性:不同Harness在交互協議、工具接口、上下文管理和工作流上差異顯著,訓練框架需要以較低的適配成本支持不同Harness,並進一步實現統一訓練。
二、執行與優化解耦:Sandbox隔離跑任務,模型邊界抓數據 針對這三道坎,ClawGym II的核心思路是將Harness執行與策略優化解耦:Harness保持原生執行邏輯,負責工具調用、上下文管理、重試恢復、subagent調度以及環境交互;訓練系統則在模型服務邊界捕獲模型側信息,結合任務獎勵完成軌跡構建與策略更新。由此,無需重新實現Harness內部複雜的控制流程,即可直接通過不同Harness對模型進行強化學習。執行層面,ClawGym II將每個任務環境與對應Harness一同運行在臨時Sandbox中。
通用Agent任務的一條rollout會在多輪交互中持續修改文件、進程和工具狀態,Sandbox在rollout開始時按需創建、結束後釋放,為每條rollout提供相互隔離的工作空間和運行環境,支撐大規模併發執行。除Harness原生提供的工具外,網頁搜索等通用能力以及任務特定工具還可以通過MCP接入,無需修改Harness原有工作流。模型側信息則通過模型邊界捕獲:雖然Harness內部控制流不可見,但所有模型行為最終都必須經過模型服務邊界。
團隊在Harness與策略模型之間部署了Serving Proxy,作為Harness的模型服務端點調用當前rollout policy完成生成,同時記錄輸入token、生成token、rollout log-probability和任務信息。任務結束後,Verifier根據最終環境狀態計算reward,並將獎勵與調用記錄一同送入訓練流程。針對真實Harness執行中的超時、連接異常和軌跡缺失等問題,框架還加入了容錯與過濾機制,保證長時程rollout的可靠性。
三、前綴樹拼回碎片軌跡,多Harness聯合訓練 Serving Proxy捕獲到的模型調用只是黑盒Harness在serving boundary上暴露出的碎片記錄,無法直接作為完整多輪軌跡訓練:相鄰調用往往包含大量重複歷史,而retry、context compaction、subagent等機制還可能讓一次rollout產生多個共享歷史的執行分支。
為此,團隊提出了基於前綴樹的軌跡重建(Prefix-Tree Reconstruction):將同一次rollout中捕獲的模型調用組織成一棵前綴樹,相同交互歷史合併為公共前綴,不同後續執行保留為獨立分支,同時恢復 Harness 插入的工具結果和環境反饋,使每條root-to-leaf路徑重新對應一條完整的多輪交互軌跡。但前綴樹中的所有分支並非都具有有效訓練信號。
框架進一步執行軌跡過濾與樹結構優化:移除retry產生的dead leaves,過濾context compaction、subagent等難以與最終任務reward建立可靠credit assignment的輔助軌跡,並直接丟棄異常過度分叉的rollout。過濾後,一次rollout仍可能保留多條共享歷史的有效軌跡,它們共同對應同一個 workspace 終態和 rollout-level reward。
訓練時,所有有效分支均參與優化,但共享前綴在整棵樹中只計算一次 loss,各分支獨有的後續token分別參與更新,從而避免因軌跡分叉而重複訓練相同歷史,也避免高度分叉的 rollout 獲得不成比例的訓練權重。在此基礎上,團隊進一步使GRPO與PPO適配一對多的樹狀軌跡結構。對於GRPO,reward normalization仍然在同一任務的多個rollout之間進行,每個rollout得到一個統一的advantage,再廣播到該rollout恢復出的全部有效軌跡.
對於PPO,則將同一rollout中的不同分支獨立進行advantage estimation,不在兄弟分支之間傳播advantage,從而在保留rollout-level reward語義的同時,使傳統策略優化算法能夠處理黑盒Harness產生的forked trajectories。除了軌跡結構,黑盒訓練還必須解決訓練與推理的一致性(Training–Inference Consistency)。在 token 層面,團隊採用Black-box Token-in-Token-out:為每次模型調用維護彼此解耦的Harness視圖和訓練視圖。
推理引擎實際生成的原始token被直接記錄並作為訓練的唯一模型輸出,而解碼後的結構化文本只交給Harness執行;即使Harness隨後進行了格式規範化、重新序列化等操作,也不會覆蓋訓練側保存的原始token。進一步地,團隊在probability層面採用token-level importance-sampling rollout correction,修正推理引擎與訓練引擎重新計算概率時產生的偏差,從token sequence和token probability兩個層面共同降低off-policy bias。
當Harness的執行邏輯與策略優化被徹底解耦後,整個訓練流程也不再綁定某一種Harness的內部實現。基於這一點,團隊進一步提出Mix-Harness Training:將Task–Harness Pair作為基本訓練實例,讓OpenClaw、Claude Code等不同 Harness 產生的rollout隨機混合進入同一個training batch,共同優化一個共享策略模型。
對於GRPO,advantage normalization在各自的Task–Harness Pair內獨立進行,避免不同Harness的交互模式和reward distribution干擾相對優勢估計;而不同Harness產生的梯度最終仍在同一步策略更新中聚合。由此,ClawGym II不僅能夠通過任意單一黑盒Harness直接訓練模型,也進一步實現了跨異構Harness的統一聯合強化學習。四、跨越多類複雜任務,黑盒RL均實現穩定提升 團隊以Qwen3-30B-A3B為主要骨幹模型,分別考察了單一Harness訓練與Mix-Harness訓練兩種設置。
在OpenClaw與Claude Code兩個結構差異顯著的Harness上,黑盒RL均帶來了顯著且可遷移的性能提升:ClawII-OC-30A3B與ClawII-CC-30A3B在ClawGym-Bench上相比各自初始化模型分別提升9.98和14.81分,在PinchBench上提升分別達到11.71和17.28分。這說明通過複雜Harness進行強化學習能夠持續提升模型的Agent能力,並遷移到新的任務分佈。
穩定性方面,在兩個Harness上,critic-based PPO與critic-free GRPO均能穩定訓練約200–400個optimization steps,training reward與下游評測表現整體持續提升,最終性能也較為接近。Mix-Harness訓練中,團隊將OpenClaw與Claude Code產生的rollout納入同一訓練過程,共同優化一個Qwen3-30B-A3B策略模型。
實驗結果顯示,該模型在兩個Harness上都能保持與對應單Harness訓練相當的training reward和下游評測表現,整個訓練過程保持穩定,說明來自不同Harness的學習信號可以在統一框架中被有效聯合優化,一個共享策略模型能夠同時適配多個異構Harness。為進一步驗證ClawGym II的通用性,團隊將黑盒強化學習擴展到 JobBench 和 OfficeQA 兩類更具挑戰、結構差異明顯的任務。
其中,JobBench面向複雜職業工作流,涉及圖片、數據庫及Office文件等多種數據形式,要求Agent跨文件理解並完成實際工作產物;OfficeQA則側重大規模文檔中的檢索、分析與多步推理,最終生成可驗證答案。針對兩類任務,團隊分別合成JobBench-style和OfficeQA-style訓練數據,並以Qwen3-30B-A3B為骨幹模型、Claude Code為Harness進行黑盒RL。得益於統一的任務接口,新任務只需定義任務指令、初始化工作空間和驗證器,即可直接接入現有訓練流程,無需修改底層RL框架。實驗結果顯示,模型在JobBench-Easy上由20.46提升至27.
20,在 OfficeQA-Full上由8.53提升至21.54,兩組訓練的reward也均保持穩定上升。這表明,ClawGym II能夠跨越不同任務形式,從複雜Workspace操作到長文檔檢索與推理,都可以在同一套黑盒RL框架下進行穩定、有效的策略優化。團隊還在一個顯式構建的簡單White-box AgentLoop上進行了強化學習,以比較不同訓練範式的效果。WhiteBox-30A3B在對應AgentLoop下達到59.90,相比初始模型提升18.21分。當這一模型直接切換到未參與訓練的OpenClaw上執行時,仍能達到50.33,相比初始模型提升5.
22分,說明簡單AgentLoop中學到的部分通用Agent能力具有一定的跨Harness遷移性。但這種遷移並不足以完全適應複雜Harness:直接通過OpenClaw進行黑盒RL的ClawII-OC-30A3B在相同評測下達到62.62,明顯高於白盒訓練模型。面對真實Harness中更復雜的交互協議與執行機制,僅依賴白盒訓練仍有差距,直接通過目標Harness進行優化才能更充分地適應其實際執行機制。結語:從藉助Harness完成任務,到通過Harness提升自己 如今,Harness不再只是模型能力的執行載體,也可以直接成為模型學習和提升的環境。
ClawGym II的實驗驗證了這種訓練範式的可行性:不同形態的真實Harness能夠接入統一的優化框架,並共同推動同一個策略模型學習。未來,團隊將繼續圍繞真實Agent系統中的學習與演進展開研究,關注模型如何在持續交互和真實執行過程中不斷適應環境、積累經驗並提升能力。沿著這一方向,ClawGym將繼續推動真實Agent系統中的模型學習與能力演進,為通用智能體的發展提供基礎支撐。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
