verl-project/verl
verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework
What it solves
verl 是专为大型语言模型 (LLM) 设计的生产级强化学习 (RL) 训练库。它解决了后训练对齐的复杂性,允许开发者以极少的代码实现多种 RL 算法 (如 PPO 和 GRPO),同时在大型 GPU 集群上保持高吞吐量和可扩展性。
How it works
该库使用混合控制器编程模型 (HybridFlow),将计算和数据依赖关系解耦。这使得它能够与各种 LLM 基础设施组件无缝集成:
- Training Backends: 支持 FSDP, FSDP2, 和 Megatron-LM。
- Rollout Generation: 集成 vLLM, SGLang, 和 Hugging Face Transformers。
- Resource Management: 使用灵活的设备映射来将模型放置在不同的 GPU 集合上,以实现最佳资源利用率。
- Efficiency: 採用 3D-HybridEngine 以减少在训练和生成阶段切换时内存冗余和通信开销。
Who it’s for
它适用于从事 LLM 后训练工作的研究人员和 engineers,特别是那些需要将 RLHF (Reinforcement Learning from Human Feedback) 扩展到极大型模型 (高达 671B 参数) 并实现高级推理或多模态 RL 的人员。
Highlights
- Algorithm Support: 提供 PPO, GRPO, GSPO, ReMax, RLOO 等算法的即用型实现。
- Broad Compatibility: 与热门的 Hugging Face 模型 (Qwen, Llama, Gemma, DeepSeek) 并支持 NVIDIA, AMD, 和 Ascend 硬件。
- Advanced Capabilities: 支持视觉语言模型 (VLMs), 多轮工具调用, 以及用于节省内存的 LoRA RL。
- High Scalability: 通过专家并行 (expert parallelism) 和 Megatron-bridge,能够在有限的硬件上扩展至万亿参数模型。
相关
- 项目
- 项目
- 项目
- 项目
- 项目