RLinf v0.3來了!從模型生態到真機部署五大能力躍升,無問芯穹與清華大學聯合打造

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> RLinf v0.3來了!
當下的具身智慧領域正處於從「數據驅動」邁向「經驗驅動」的關鍵轉折點,機器人不再滿足於靜態模仿,而是需要在真實世界中持續學習與在線進化。然而,強化學習流程繁瑣、系統組件異質、資源形態多樣,以及真實世界在線學習難以規模化等問題,已成為阻礙具身智慧走入真實應用的核心痛點。為此,由無問芯穹與清華大學等單位共同研發的全球首個面向具身智慧持續進化的大規模強化學習基礎設施專案「RLinf」,正式宣布推出 v0.3 版本,定位為新一代的「進化底座」,試圖破解該行業的發展瓶頸。RLinf 的前兩個版本 v0.1 與 v0.2 分別完成了強化學習系統的抽象層建構以及真實世界在線學習的基礎設施建設。最新的 v0.
3 則進一步升級為一站式開發平台,首次完整打通數據採集、數據管理、監督微調(SFT)、強化學習(RL)、模型評測以及真機部署等關鍵環節,形成從模擬訓練到真實機器人在線學習、再到持續迭代優化的統一開發閉環。這意味著 RLinf 不僅能高效訓練機器人策略,更能支撐機器人在真實環境中長期且持續地進化。本次版本更新圍繞模型、演算法、真機、模擬、系統五大維度全面升級,系統性降低具身智慧的開發門檻,並提升訓練效率與部署靈活性。在模型生態方面,v0.
3 新增六款主流具身模型支援,涵蓋世界模型、VLA(Vision-Language-Action)模型及系統級加速,包括 Dexbotic DM0 在 LIBERO 環境中以 PPO 進行在線 RL 微調、DreamZero 模型基於 WAN2.1/2.2 影片生成世界模型微調的 VLA 策略,並透過 FSDP2 與 CUDA Graph 等加速技術取得近四倍吞吐量提升。此外也納入 GR00T-N1.6 / N1.7、ABot-M0、StarVLA(支援 GRPO on LIBERO)以及 LingBot-VLA 等模型,大幅擴充開發生態。在演算法體系上,v0.
3 實現在真機 RL、模擬 RL 與人在迴圈學習三大方向的重要演算法新增,展現出領先的真機任務成功率。真機強化學習方面,將 DSRL(Diffusion Steering via Reinforcement Learning)擴展至 Pi0.5 模型,新增 RECAP(基於離線優勢估計的策略最佳化)訓練流水線,並加入 SAC-Flow 演算法,擴展至 DOS-W1 等真實場景。模擬強化學習方面,Async PPO 擴展支援 MLP 等新策略,新增 async DSRL 配置,以及 D4RL 離線 IQL 訓練支援。
人在迴圈學習則新增 DAgger 在線模仿學習演算法與 HG-DAgger(Human-Gated DAgger)真機在線訓練支援,涵蓋 LIBERO、ManiSkill、RoboTwin 及真實機器人場景。真機支援是 v0.3 的一大亮點,新版全面打通從數據採集到真機部署的全鏈路閉環。新增三種遙操作方式——空間滑鼠(Spacemouse)、VR 遙操作與 GELLO 遙操作數據採集支援;同時新增三款真機平台:雙臂 Franka 平台、GimArm 平台與 DOS-W1 平台,以及 Franka DexHand 靈巧手與 Robotiq 夾爪等末端執行器。
訓練鏈路方面,新增 LeRobot 格式數據採集支援,便於與 HuggingFace LeRobot 生態互通;新增 Pi0 真機 SFT 部署支援,打通數據採集→SFT→真機部署的完整流程,並新增真機 reward model 數據採集功能。模擬環境方面,v0.3 提升場景覆蓋度,新增 Genesis、Polaris、RoboVerse 等五種模擬器,完善 Behavior 環境支援,加入 Libero+ / LiberoPro 變體環境,以及 Embodichain(CartPole)環境與 IsaacLab 上 π0.5 PPO 微調支援。
同時也新增 RoboCasa close-drawer 等 RL 範例,讓開發者能更靈活地進行模擬訓練。系統基座層面,RLinf v0.3 導入多項重磅組件。Reward Model 組件支援 embodied reward worker 與 ResNet/VLM reward model;Value Model 組件作為通用基礎設施,支撐 Pi0.
6 RECAP 等流水線;SGLang 推理服務化組件提供 HTTP server 與 router 模式,可作為 reward 服務或 rollout 推理後端;環境執行組件則解除 Env Worker 與 Rollout Worker 一對一綁定,提升 GPU 利用率。效能最佳化方面,新增 torch.compile 加速、rollout 與訓練 overlap、權重同步升級(broadcast/增量同步/分桶同步/僅同步可訓練參數)、FSDP 全 offload 支援,並修復了顯存洩漏等關鍵問題。值得注意的是,v0.
3 全面支援昇騰 Ascend(CANN/torch-npu)、AMD ROCm、Musa 等國產及異構 AI 運算平台,真正實現跨機器人、跨模型、跨模擬器、跨計算硬體的統一訓練能力。此外,RLinf v0.3 也為智慧體(Agentic AI)的 RL 場景提供更強大的訓練與評測基礎,新增 AgentLightning 多輪單智慧體 RL 訓練與 Calc-X 評測支援、Megatron-Bridge actor 後端支援,並將 SearchR1 重構為多輪介面,新增 WideSeek judge 的內建 sglang 支援。自開源以來,RLinf 以開放共享為核心理念迅速形成全球影響力。
截至目前在 GitHub 上已獲得超過 4100 顆星、600 多個分支與 100 多位貢獻者,成為具身智慧與大模型強化學習領域最受關注的基礎設施專案之一。RLinf 已被 Isaac Lab 官方收錄為首個面向具身大模型的訓練引擎,展現其國際技術引領能力。RLinf 團隊與 NVIDIA 團隊合作的醫療器械組裝任務更成功登上 NVIDIA GTC 2026,進一步驗證其全球技術影響力。此外,該專案榮獲 EAI-100 年度十大突破獎,並入選 Pytorch Ecosystem 與螞蟻開源榜,代表業界對其技術領先性與價值的肯定。
未來,RLinf 將持續堅持開源路線,提升易用性,並攜手社群共同貢獻前沿演算法。團隊已建立開發路線圖與答疑社群,邀請更多研究者加入,共同推動具身智慧基礎設施的進化。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。