verl-project/verl

verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework

What it solves

verl 是专为大型语言模型 (LLM) 设计的生产级强化学习 (RL) 训练库。它解决了后训练对齐的复杂性,允许开发者以极少的代码实现多种 RL 算法 (如 PPO 和 GRPO),同时在大型 GPU 集群上保持高吞吐量和可扩展性。

How it works

该库使用混合控制器编程模型 (HybridFlow),将计算和数据依赖关系解耦。这使得它能够与各种 LLM 基础设施组件无缝集成:

  • Training Backends: 支持 FSDP, FSDP2, 和 Megatron-LM。
  • Rollout Generation: 集成 vLLM, SGLang, 和 Hugging Face Transformers。
  • Resource Management: 使用灵活的设备映射来将模型放置在不同的 GPU 集合上,以实现最佳资源利用率。
  • Efficiency: 採用 3D-HybridEngine 以减少在训练和生成阶段切换时内存冗余和通信开销。

Who it’s for

它适用于从事 LLM 后训练工作的研究人员和 engineers,特别是那些需要将 RLHF (Reinforcement Learning from Human Feedback) 扩展到极大型模型 (高达 671B 参数) 并实现高级推理或多模态 RL 的人员。

Highlights

  • Algorithm Support: 提供 PPO, GRPO, GSPO, ReMax, RLOO 等算法的即用型实现。
  • Broad Compatibility: 与热门的 Hugging Face 模型 (Qwen, Llama, Gemma, DeepSeek) 并支持 NVIDIA, AMD, 和 Ascend 硬件。
  • Advanced Capabilities: 支持视觉语言模型 (VLMs), 多轮工具调用, 以及用于节省内存的 LoRA RL。
  • High Scalability: 通过专家并行 (expert parallelism) 和 Megatron-bridge,能够在有限的硬件上扩展至万亿参数模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目