nvidia-cosmos/cosmos-rl
Cosmos-RL is a flexible and scalable Reinforcement Learning framework specialized for Physical AI applications.
解决的问题
Cosmos-RL 专为应对物理 AI 应用的大规模强化学习(RL)训练复杂性而设计,提供一个可扩展且灵活的框架,用于管理具身智能体训练带来的高计算负载。
工作原理
该框架采用解耦的单控制器架构,将训练过程划分为专门的角色:
- 策略(消费者): 专用于训练实例的副本。
- 回放(生产者): 专用于生成引擎的副本。
- 控制器: 一个高效的通信系统,协调策略副本与回放副本之间的权重和回放数据。
为最大化性能,支持多种并行策略(Tensor、Sequence、Context、FSDP 和 Pipeline),并利用低精度训练与回放(FP8 和 FP4)以减少内存和计算开销。
适用人群
面向从事物理 AI 研究的开发者和研究人员,例如机器人、自动驾驶车辆和智能空间领域,需要实现大规模强化学习训练负载的用户。
核心亮点
- 高级并行化: 支持五种不同类型的并行策略,可在 GPU 间分布工作负载。
- 异步架构: 解耦策略与回放副本,提升整体效率。
- 弹性训练: 使用动态 NCCL 进程组,支持 GPU 在运行时动态注册或注销,确保容错能力。
- 低精度支持: 针对 FP8 和 FP8/FP4 精度进行优化,加速训练与回放过程。
相关
- 项目
- 项目
- 项目
- 项目
- 项目