英偉達開源Molt框架
重點摘要
Home Uncategorized NVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning Framework Uncategorized Agentic reinforcement learning research is constant algorithm modification.
NVIDIA 旗下 NeMo 團隊正式開源一套名為 Molt 的強化學習框架,鎖定近年快速發展的 agentic reinforcement learning 研究場景。這類研究最大的痛點在於演算法迭代頻繁,新的估計器、新的管線階段、新的 rollout 方案不斷出現;但在主流框架中,任何一項改動都必須穿透 trainer、分散式後端與 rollout 膠水層,成本最後都落在研究者身上。Molt 的定位就是直接針對這項成本提出解方,以 PyTorch 原生架構打造,並設定了一個相當特別的設計目標:程式碼庫必須緊湊到研究者能整包放進腦中理解,同時也能讓 AI 程式設計助手完整閱讀與推理。 這項目標反映在具體的程式碼規模上。根據該團隊以框架 RL 進入點追蹤 import graph 的測量方式,Molt 的 RL 核心程式碼約為 8.6K 行;同樣方式計算,verl 約為 62K 行,slime 約為 25K 行,OpenRLHF 約為 7.2K 行。換句話說,Molt 的程式碼體積約為 verl 的七分之一,卻涵蓋了可運行的 agentic RL 訓練能力。 Molt 並非只是研究原型,它具備實際部署條件。框架以 Apache 2.0 授權釋出,內附 launch codes、Slurm 腳本以及預先建置好的容器。不過研究論文將它定位為研究基礎設施,而非生產級訓練服務,真正的門檻在於硬體。官方提供的 recipes 預設使用 2 個節點、每節點 8 張 H100 GPU,其中 8 張負責訓練、8 張負責 rollout。這樣的規格將 Molt 的使用者圈在具備前沿或接近前沿算力的機構,包括資金充裕、正在做 post-training 的 AI 新創,金融、醫療與機器人領域中需要針對自有環境訓練 agent 的企業研究團隊,以及擁有跨節點 H100/H200 資源的學術實驗室。 Molt 的架構由三個元件組成,並以組合而非改寫的方式串接:Ray 負責資源放置與非同步佇列,vLLM 負責 rollout 推論,NVIDIA AutoModel 搭配 FSDP2 負責訓練。這三個元件都沒有被 fork,因此上游更新不需要歷經痛苦的 rebase 過程,只需更新容器 pin 版本即可跟進。 在執行時期,Molt 的運作核心是一個 agent pool,也就是一組放在請求路由器後方的 vLLM 引擎,搭配單一可訓練的策略 actor。系統採用 streaming pool 設計,讓 prompt groups 持續在 flight 狀態中,即使 actor 正在訓練,引擎也不會進入空轉狀態。當發生部分 rollout 時,系統會暫停引擎,透過 NCCL 直接將 actor 的模型分片廣播到每一顆引擎,然後恢復先前保留的請求,而不是將已經產生的軌跡丟棄重來。 Molt 對 agent 的定義相當輕量:一次 RL 執行只需要指定一個匯出 AgentRunner 的 Python 模組,其餘所有程式碼都是普通程式,包含 reward 函式在內。框架支援兩種 agent 形式。第一種是 Env,由框架本身在 Gymnasium 對齊的 step() 介面中掌控 LLM 迴圈;第二種是 ChatAgent,由使用者透過標準的 OpenAI 或 Anthropic SDK 自主掌控迴圈。Molt 會啟動一個 loopback server,同時支援這兩種 wire protocol,每個請求都會在伺服器端以逐 token 精確的方式累積,確保訓練資料不會因通訊協定轉換而失真。當長程 agent 需要壓縮上下文或改寫 prefix 時,伺服器會自動封存目前區段,並開啟一個新的區段,因此不會污染已經產生的軌跡。 為了確保正確性,Molt 以三個不變量貫穿整體設計。第一是 token identity:軌跡由實際被取樣的 token id 定義,而不是由重新 tokenize 後的轉錄文字定義。第二是 policy-version semantics:可訓練 token 保留行為策略下的 log-probabilities,非同步使用情境則在序列級門控後進行逐 token 修正。第三是 forward consistency:rollout 與 actor 必須對模型語義有完全一致的解讀。 第三個不變量在 mixture-of-experts 策略中尤為關鍵。MoE 模型的 rollout 與訓練路由器各自獨立選擇 expert,微小的數值差異就有可能翻轉 top-k 選擇,導致訓練訊號失真。Molt 為此實作 rollout routing replay:vLLM 會回傳每個 token 的 expert ids,訓練端在 forward 階段直接重放這些選擇,避免因路由不一致而產生的偏差。 效能方面,Molt 在吞吐量上與基於 Megatron 的既有技術堆疊達到統計上相當的水準,團隊也如實揭露了 MoE 情境中可能出現的不匹配限制。此外,規模擴展對 Molt 來說只是一個旗標參數:同一套程式迴圈可以訓練 dense 4B 模型,也能以 --fsdp.ep_size 256 的設定訓練 700B MoE 模型,不需要為不同規模改寫架構。 就應用場景而言,Molt 可涵蓋多輪工具使用 agent、程式碼執行 agent、視覺語言環境(內附 geo3k recipe)、以 LLM 作為評審的獎勵迴圈,以及將行為策略蒸餾到較小學生模型的 on-policy distillation。整體而言,Molt 以極簡核心、不 fork 外部元件、逐 token 精確的資料路徑,加上可從 4B 一路擴展到 700B 的規模彈性,為 agentic RL 研究提供了一個更輕量、更透明的實驗基底。目前論文與開源程式碼皆已公開,供研究社群直接取用。
Related
相關文章

AI不再用完即忘:華為諾亞開源MindMemOS,記憶和Skill一起進化
華為諾亞方舟實驗室開源MindMemOS,這是一個面向AI Agent的可遷移、自演進記憶操作層,將記憶從單一Agent中解耦,並以實體、屬性、時間三維結構保存最新狀態與演化軌跡。系統透過Dreaming離線鞏固記憶、Feedback挖掘用戶糾正性反饋,並支援Skill版本演進,在LoCoMo、PersonaMem等基準上取得領先成績,同時提升SpreadsheetBench任務成功率。

從TPU到自我進化的Agent,Jeff Dean如何判斷AI的下一步
這篇消息聚焦「從TPU到自我進化的Agent,Jeff Dean如何判斷AI的下一步」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
Jeff Dean研判智能體方向
Jeff Dean研判智能體方向。 Jeff Dean稱智能體將長期試錯。TPU經驗⚙️提示應先鎖定算力瓶頸。查看模型創業趨勢完整訪談提出尋找模型盲區。上下文工程正成為新護城河。產品品味將比基礎編碼更稀缺。
鵜鶘測試引爆AI爭論
鵜鶘測試引爆AI爭論。 Karpathy用Pelican���檢驗生成能力。社區在鵜鶘測試原帖熱議(AI資訊)裡質疑革命。Wave式協作���被重新想起。Agent與版權爭議仍在發酵。
k-skill深耕韓國本地語境
k-skill深耕韓國本地語境。 項目為智能體補齊韓國任務能力。技能庫收錄本地語境與實用工具。查看韓國智能體技能倉庫已獲**6886**。項目單日新增🌱177顆星。本地化智能體生態開始快速擴散。

Loop才火了六週,AI Coding為什麼又開始談Graph?
這篇消息聚焦「Loop才火了六週,AI Coding為什麼又開始談Graph?」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。