RLinf/RLinf
RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI
解決的問題
RLinf 提供一個可擴展且彈性的強化學習(RL)訓練基礎設施,特別針對具身智能(機器人)與智能體智能(Agentic AI)。它消除分散式程式設計的複雜性,讓開發者無需修改程式碼即可在多個 GPU 節點上擴展訓練,並優化高效率 RL 訓練的吞吐量。
工作原理
RLinf 作為強化學習訓練的穩健骨幹,支援多種演算法(如 PPO、GRPO 和 SAC),並與多種後端(如 FSDP、HuggingFace、SGLang 和 vLLM)整合。它採用混合執行模式以提升具身強化學習的吞吐量,並支援廣泛的加速器,包括 NVIDIA GPU、摩爾線程(MUSA)、華為昇騰(CANN)與 AMD(ROCm)。
適用對象
專為從事視覺-語言-動作(VLA)模型、機器人策略學習與智能體 AI 的研究人員與開發者設計,適用於需要處理大規模分散式訓練與真實機器人部署的系統需求。
主要亮點
- 廣泛的硬體支援:相容 NVIDIA、AMD、華為昇騰與摩爾線程加速器。
- 豐富的模擬器整合:支援 Isaac Lab、LIBERO、RoboCasa、Metaworld 等多種模擬器。
- 真實世界能力:包含 RLinf-USER,可在 Franka 與 XSquare Turtle2 等實體機器人上進行線上策略學習。
- 系統優化:提供 DynaRL 實現動態計算資源重分配,以及 FUSCO 加速 MoE 通訊。
- 多樣的 RL 支援:涵蓋從離線 IQL 和 SFT 到線上 RL 與大模型 GRPO 微調的完整流程。
相關
- 專案
- 專案
- 專案
- 專案
- 專案