OpenRLHF/OpenRLHF

An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

解决的问题

OpenRLHF 是一个高性能、生产级的框架,旨在使人类反馈强化学习 (RLHF) 具有可扩展性和可扩展性。通过将高吞吐量推理引擎与分布式训练架构相结合,它解决了样本生成的瓶颈——这通常消耗了 RLHF 训练时间的 80%。

工作原理

该框架利用分布式架构,结合了用于调度和模型分离(Actor、Reward、Reference 和 Critic 模型)的 Ray、用于高性能样本生成的 vLLM 以及用于内存高效训练的 DeepSpeed ZeRO-3

其核心创新在于统一的基于代理的设计范式。它将每次训练运行视为“token-in-token-out”代理执行,允许同一流水线同时支持单轮 RLHF(标准单次生成)和多轮 RLHF(与环境反馈的复杂交互)。这种设计将 RL 算法与执行模式解耦,这意味着任何支持的算法都可以与任何代理模式配合使用。

适用对象

它专为需要使用 RLHF 训练大规模语言模型(高达 70B+ 参数)的研究人员和工程师而构建,特别是那些从事推理模型、视觉语言模型 (VLM) 或交互式代理工作的人员。

亮点

  • 多样化的 RL 算法:支持 PPO、REINFORCE++、GRPO 和 RLOO。
  • 基于代理的执行:统一的单轮和多轮交互流水线,包括对外部环境反馈的支持。
  • VLM 支持:具备使用图像输入和多轮图像反馈训练视觉语言模型的能力。
  • 混合引擎调度:通过允许模型和 vLLM 引擎共享资源,实现 GPU 利用率最大化。
  • 可扩展性:集成了用于长上下文训练的 DeepSpeed AutoTP 和 RingAttention,以及通过 SLURM 实现的多节点扩展。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目