VLARLKit/VLARLKit
Elegant VLA-RL library
解决的问题
VLARLKit 为使用强化学习 (RL) 训练 Vision-Language-Action (VLA) 模型提供了研究人员友好的框架。它通过将基础模型、RL 训练栈和机器人仿真环境解耦为独立的项目和进程,解决了这些组件之间常见的依赖冲突问题。
工作原理
该库采用模块化架构,将 policy、rollout、runner 和 model 层分离。为了防止软件冲突,它采用了依赖解耦设计,其中模型后端作为独立项目管理,基准测试环境作为独立的 ZMQ 进程运行。它支持 on-policy 和 off-policy 训练,包括允许数据收集与模型更新同步进行的异步 off-policy 训练。
适用对象
专为从事具身智能 (embodied intelligence) 和 VLA 模型研究、需要灵活且易于扩展的 PyTorch 库进行 RL 实验的 AI 研究人员设计。
亮点
- 解耦架构:分离基础模型和模拟器依赖,避免安装冲突。
- 广泛的算法支持:包括 on-policy (PPO, GRPO)、off-policy (DSRL, RLT) 和基于模型的 RL (VLA-MBPO)。
- VLA 模型集成:支持 π†.₅ 等基于流的模型和 OpenVLA-OFT 等自回归模型。
- 仿真基准测试:集成支持 LIBERO、ManiSkill 和 RoboTwin。
相关
- 项目
- 项目
- 项目
- 项目
- 项目