verl-project/verl
verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework
What it solves
verl は、大規模言語モデル (LLM) 専用に設計された、プロダクションレディな強化学習 (RL) 訓練ライブラリです。後訓練アライメントの複雑さを解消し、開発者が PPO や GRPO などの多様な RL アルゴリズムを最小限のコードで実装可能にし、大規模 GPU クラスター上で高スループットとスケーラビリティを維持します。
How it works
このライブラリは、計算とデータの依存関係を分離するハイブリッドコントローラー・プログラミングモデル (HybridFlow) を使用しています。これにより、さまざまな LLM インフラストラクチャ・コンポーネントとシームレスに統合可能です:
- Training Backends: FSDP, FSDP2, および Megatron-LM をサポート。
- Rollout Generation: vLLM, SGLang, および Hugging Face Transformers と統合。
- Resource Management: 柔軟なデバイス・マッピングを使用して、モデルを異なる GPU セットに配置し、最適なリソース・リソース利用率を実現。
- Efficiency: 3D-HybridEngine を採用し、訓練と生成フェーズの切り替え時におけるメモリ冗長性と通信オーバーヘッドを低減。
Who it’s for
LLM の後訓練 (post-training) に携わる研究者やエンジニア向けです。特に、RLHF (Reinforcement Learning from Human Feedback) を非常に大規模なモデル (最大 671B パラメータ) にスケーリングさせる必要がある研究者や、高度な推論やマルチモーダル RL を実装する層に向けられています。
Highlights
- Algorithm Support: PPO, GRPO, GSPO, ReMax, RLOO など、すぐに使える実装が用意されています。
- Broad Compatibility: 人気の Hugging Face モデル (Qwen, Llama, Gemma, DeepSeek) と連携し、NVIDIA, AMD, および Ascend ハードウェアをサポート。
- Advanced Capabilities: 視覚と言語のモデル (VLMs)、マルチターン・ツール・コーリング、およびメモリ節約のための LoRA RL をサポート。
- High Scalability: Expert parallelism と Megatron-bridge を介して、限られたハードウェア上で兆単位のパラメータ数を持つモデルへのスケーリングが可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト