alibaba/ROLL

An Efficient and User-Friendly Scaling Library for Reinforcement Learning with Large Language Models

解決する課題

ROLLは、大規模なGPUクラスターを使用する場合に、大規模言語モデル(LLM)の強化学習(RL)をより効率的かつ使いやすくするために設計されたスケーリングライブラリです。トレーニングと推論の両方を最適化する分散アーキテクチャを提供することで、人間の好みの整合性、複雑な推論、およびマルチターンのエージェント的インタラクションの課題に対処します。

仕組み

ROLLは、柔軟なリソース割り当てとタスクスケジューリングのために、Rayによって駆動されるマルチロール分散アーキテクチャを使用しています。プロセスを加速するために、いくつかの高性能なバックエンドを統合しています:

  • Inference/Generation: vLLM および SGLang を使用。
  • Training: FSDP2 および Megatron-LM 5D 並列処理(データ、テンソル、パイプライン、コンテキスト、およびエキスパートの並列処理を含む)をサポート。
  • Optimization: ボトルネックを軽減するために、サンプルレベルの非同期並列ロールアウトと非同期トレーニングを実装。
  • Device Management: さまざまなロールがGPUにどのようにデプロイされるかを管理する「AutoDeviceMapping」機能を搭載。

対象ユーザー

LLMのポストトレーニングに取り組む研究者や開発者、特に RLVR(Verifiable Rewardsからの強化学習)、マルチターンインタラクションのためのエージェント的RL、およびLLMとVLM(Vision-Language Models)の両方の蒸留パイプラインに焦点を当てている方を対象としています。

ハイライト

  • 包括的なRLアルゴリズムのサポート: PPO, GRPO, Reinforce++, TOPR, RAFT++, GSPO を即座にサポート。
  • マルチタスク機能: 数学、コーディング、一般的な推論、および指示への従順さを処理。
  • エージェント的RLのサポート: マルチターン対話、ゲーム、ツール使用のための専用ツールを備え、軌跡ベース(trajectory-wise)とステップベース(step-wise)の両方のトレーニングパラダイムをサポート。
  • ハードウェアの柔軟性: NVIDIA GPU、AMD GPU、および Ascend NPU と互換性があります。
  • 高度なトレーニング機能: LoRA トレーニング、FP8 ロールアウト、およびGPU利用率を最大化するための極限のオフロード/リロード機能をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト