何夕2077AI Agent

英偉達開源Molt框架

2026年8月3日 00:00

重點摘要

Home Uncategorized NVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning Framework Uncategorized Agentic reinforcement learning research is constant algorithm modification.

站內 AI 整理稿

NVIDIA 旗下 NeMo 團隊正式開源一套名為 Molt 的強化學習框架,鎖定近年快速發展的 agentic reinforcement learning 研究場景。這類研究最大的痛點在於演算法迭代頻繁,新的估計器、新的管線階段、新的 rollout 方案不斷出現;但在主流框架中,任何一項改動都必須穿透 trainer、分散式後端與 rollout 膠水層,成本最後都落在研究者身上。Molt 的定位就是直接針對這項成本提出解方,以 PyTorch 原生架構打造,並設定了一個相當特別的設計目標:程式碼庫必須緊湊到研究者能整包放進腦中理解,同時也能讓 AI 程式設計助手完整閱讀與推理。

這項目標反映在具體的程式碼規模上。根據該團隊以框架 RL 進入點追蹤 import graph 的測量方式,Molt 的 RL 核心程式碼約為 8.6K 行;同樣方式計算,verl 約為 62K 行,slime 約為 25K 行,OpenRLHF 約為 7.2K 行。換句話說,Molt 的程式碼體積約為 verl 的七分之一,卻涵蓋了可運行的 agentic RL 訓練能力。Molt 並非只是研究原型,它具備實際部署條件。框架以 Apache 2.0 授權釋出,內附 launch codes、Slurm 腳本以及預先建置好的容器。

不過研究論文將它定位為研究基礎設施,而非生產級訓練服務,真正的門檻在於硬體。官方提供的 recipes 預設使用 2 個節點、每節點 8 張 H100 GPU,其中 8 張負責訓練、8 張負責 rollout。這樣的規格將 Molt 的使用者圈在具備前沿或接近前沿算力的機構,包括資金充裕、正在做 post-training 的 AI 新創,金融、醫療與機器人領域中需要針對自有環境訓練 agent 的企業研究團隊,以及擁有跨節點 H100/H200 資源的學術實驗室。

Molt 的架構由三個元件組成,並以組合而非改寫的方式串接:Ray 負責資源放置與非同步佇列,vLLM 負責 rollout 推論,NVIDIA AutoModel 搭配 FSDP2 負責訓練。這三個元件都沒有被 fork,因此上游更新不需要歷經痛苦的 rebase 過程,只需更新容器 pin 版本即可跟進。在執行時期,Molt 的運作核心是一個 agent pool,也就是一組放在請求路由器後方的 vLLM 引擎,搭配單一可訓練的策略 actor。

系統採用 streaming pool 設計,讓 prompt groups 持續在 flight 狀態中,即使 actor 正在訓練,引擎也不會進入空轉狀態。當發生部分 rollout 時,系統會暫停引擎,透過 NCCL 直接將 actor 的模型分片廣播到每一顆引擎,然後恢復先前保留的請求,而不是將已經產生的軌跡丟棄重來。Molt 對 agent 的定義相當輕量:一次 RL 執行只需要指定一個匯出 AgentRunner 的 Python 模組,其餘所有程式碼都是普通程式,包含 reward 函式在內。框架支援兩種 agent 形式。

第一種是 Env,由框架本身在 Gymnasium 對齊的 step() 介面中掌控 LLM 迴圈;第二種是 ChatAgent,由使用者透過標準的 OpenAI 或 Anthropic SDK 自主掌控迴圈。Molt 會啟動一個 loopback server,同時支援這兩種 wire protocol,每個請求都會在伺服器端以逐 token 精確的方式累積,確保訓練資料不會因通訊協定轉換而失真。當長程 agent 需要壓縮上下文或改寫 prefix 時,伺服器會自動封存目前區段,並開啟一個新的區段,因此不會污染已經產生的軌跡。為了確保正確性,Molt 以三個不變量貫穿整體設計。

第一是 token identity:軌跡由實際被取樣的 token id 定義,而不是由重新 tokenize 後的轉錄文字定義。第二是 policy-version semantics:可訓練 token 保留行為策略下的 log-probabilities,非同步使用情境則在序列級門控後進行逐 token 修正。第三是 forward consistency:rollout 與 actor 必須對模型語義有完全一致的解讀。第三個不變量在 mixture-of-experts 策略中尤為關鍵。

MoE 模型的 rollout 與訓練路由器各自獨立選擇 expert,微小的數值差異就有可能翻轉 top-k 選擇,導致訓練訊號失真。Molt 為此實作 rollout routing replay:vLLM 會回傳每個 token 的 expert ids,訓練端在 forward 階段直接重放這些選擇,避免因路由不一致而產生的偏差。效能方面,Molt 在吞吐量上與基於 Megatron 的既有技術堆疊達到統計上相當的水準,團隊也如實揭露了 MoE 情境中可能出現的不匹配限制。

此外,規模擴展對 Molt 來說只是一個旗標參數:同一套程式迴圈可以訓練 dense 4B 模型,也能以 --fsdp.ep_size 256 的設定訓練 700B MoE 模型,不需要為不同規模改寫架構。就應用場景而言,Molt 可涵蓋多輪工具使用 agent、程式碼執行 agent、視覺語言環境(內附 geo3k recipe)、以 LLM 作為評審的獎勵迴圈,以及將行為策略蒸餾到較小學生模型的 on-policy distillation。

整體而言,Molt 以極簡核心、不 fork 外部元件、逐 token 精確的資料路徑,加上可從 4B 一路擴展到 700B 的規模彈性,為 agentic RL 研究提供了一個更輕量、更透明的實驗基底。目前論文與開源程式碼皆已公開,供研究社群直接取用。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

17 分鐘前

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

23 分鐘前
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

5 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

10 小時前