RLinf/RLinf
RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI
解决的问题
RLinf 提供了一个可扩展且灵活的强化学习(RL)训练基础设施,特别针对具身智能(机器人)和智能体智能(Agentic AI)。它消除了分布式编程的复杂性,使开发者无需修改代码即可在多个 GPU 节点上扩展训练,并优化了高性能强化学习训练的吞吐量。
工作原理
RLinf 作为强化学习训练的稳健骨干,支持多种算法(如 PPO、GRPO 和 SAC),并与多种后端(如 FSDP、HuggingFace、SGLang 和 vLLM)集成。它采用混合执行模式来提升具身强化学习的吞吐量,并支持广泛的加速器,包括 NVIDIA GPU、摩尔线程(MUSA)、华为昇腾(CANN)和 AMD(ROCm)。
适用人群
专为从事视觉-语言-动作(VLA)模型、机器人策略学习和智能体 AI 的研究人员和开发者设计,适用于需要处理大规模分布式训练和真实机器人部署的系统需求。
主要亮点
- 广泛的硬件支持:兼容 NVIDIA、AMD、华为昇腾和摩尔线程加速器。
- 丰富的模拟器集成:支持 Isaac Lab、LIBERO、RoboCasa、Metaworld 等多种模拟器。
- 真实世界能力:包含 RLinf-USER,可在 Franka 和 XSquare Turtle2 等物理机器人上进行在线策略学习。
- 系统优化:提供 DynaRL 实现动态计算资源重分配,以及 FUSCO 加速 MoE 通信。
- 多样的 RL 支持:涵盖从离线 IQL 和 SFT 到在线 RL 和大模型 GRPO 微调的完整流程。
相关
- 项目
- 项目
- 项目
- 项目
- 项目