verl-project/verl

verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework

What it solves

verl 是專為大型語言模型 (LLM) 設計的生產級強化學習 (RL) 訓練庫。它解決了後訓練對齊的複雜性,讓開發者能以極少的代碼實作多種 RL 演算法 (例如 PPO 和 GRPO),同時在大型 GPU 集群上保持高吞吐量和可擴展性。

How it works

該庫使用混合控制器編程模型 (HybridFlow),將計算與數據依賴關係解耦。這使其能夠與各種 LLM 基礎設施組件無縫集成:

  • Training Backends: 支持 FSDP, FSDP2, 和 Megatron-LM。
  • Rollout Generation: 集成 vLLM, SGLang, 和 Hugging Face Transformers。
  • Resource Management: 使用靈活的設備映射來將模型放置在不同的 GPU 集群上,以實現最佳資源利用率。
  • Efficiency: 採用 3D-HybridEngine 以減少在訓練與生成階段切換時的內存冗餘和通信開銷。

Who it’s for

它適用於從事 LLM 後訓練工作的研究人員和工程師,特別是那些需要將 RLHF (Reinforcement Learning from Human Feedback) 擴展到極大型模型 (高達 671B 參數) 並實施進階推理或多模態 RL 的人員。

Highlights

  • Algorithm Support: 提供 PPO, GRPO, GSPO, ReMax, RLOO 等演算法的即用型實作。
  • Broad Compatibility: 與熱門的 Hugging Face 模型 (Qwen, Llama, Gemma, DeepSeek) 相容,並支持 NVIDIA, AMD, 和 Ascend 硬體。
  • Advanced Capabilities: 支持視覺語言模型 (VLMs), 多輪工具調用, 以及用於節省內存的 LoRA RL。
  • High Scalability: 通過專家並行 (expert parallelism) 和 Megatron-bridge,能夠在有限的硬體上擴展至兆級參數模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案