rllm-org/rllm

Democratizing Reinforcement Learning for LLMs

解決する課題

rLLMは、強化学習(RL)を用いた言語エージェントのトレーニングプロセスを簡素化します。異なる環境やトレーニングバックエンドに合わせてエージェントのコードを書き換える手間を省き、同一のエージェントロジックをさまざまなベンチマークやサンドボックスでの評価とトレーニングの両方に使用できるようにします。

仕組み

rLLMは、エージェントを実行し、トレースを収集し、報酬を計算し、モデルを更新するパイプラインを使用します。URLルーティングされたセッションを介してLLM呼び出しからトークンIDとlogprobsを透過的にキャプチャするモデルゲートウェイを採用しています。これにより、エージェントの元のコードを変更することなく、エージェントのインタラクションをEpisodes、Trajectories、Stepsとして構造化できます。このフレームワークは、複数のトレーニングバックエンド(verl、tinker、fireworksなど)をサポートしており、コストを削減するためのスナップショットやウォームプール加速を備えたさまざまなサンドボックス(Docker、Daytona、Modalなど)でエージェントを実行できます。

対象者

GRPO、REINFORCE、RLOOなどのRL手法を使用して、エージェントプログラムをトレーニングおよび評価するための標準化された方法を必要とするAI研究者および業界のチーム。

ハイライト

  • バックエンド非依存: 単一のフラグで、分散マルチGPUトレーニング(verl)、シングルマシントレーニング(tinker)、およびFireworksプラットフォームを切り替え可能。
  • 広範なベンチマーク統合: 数学、コード、QA、エージェントタスク(例:SWE-bench、AIME)をカバーする60以上の統合ベンチマークを含む。
  • 柔軟なハーネス: 10以上のCLIハーネスをサポートし、シンプルなデコレータを使用してユーザー自身のエージェント(例:LangGraphやOpenAI Agents SDK)をラップすることを可能にする。
  • サンドボックスサポート: 安全でスケーラブルなロールアウトを保証するために、複数のサンドボックス環境と互換性がある。
  • 実証済みの成果: DeepScaleR、DeepCoder、DeepSWEなどの最先端のオープンソースモデルの作成に使用されている。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト