AgileRL/AgileRL

Streamlining reinforcement learning with RLOps. State-of-the-art RL algorithms and tools, with 10x faster training through evolutionary hyperparameter optimization.

AgileRL – ビルトインRLOpsを備えた強化学習ライブラリ

何であるか – AgileRLは、最新の強化学習(RL)アルゴリズム(オンポリシー、オフポリシー、オフライン、マルチエージェント、バンディット、LLMファインチューニングなど)を統合したオープンソースのPythonライブラリです。さらに、進化的ハイパーパラメータ最適化(HPO)と分散トレーニングのためのツールセットも提供します。開発者たちはこの組み合わせをRLOpsと呼んでおり、RLワークロードにおけるMLOpsの類似物です。

主なアイデア

  • 進化的HPO – 数十もの独立した実験を実行するのではなく、AgileRLはエージェントの集団を進化させ、数千ステップごとにハイパーパラメータとネットワークアーキテクチャを変異させます。READMEによると、従来のOptunaベースのパイプラインと比べて最大10倍速いHPOが可能とされています。
  • モジュール式トレーナーLocalTrainer(単一マシン用)とクラウドプラットフォームArenaのSDK/CLIにより、単一エージェント、集団、またはカスタムパイプラインのトレーニングが可能です。
  • 広範なアルゴリズムカバレッジ – PPO、DQN(Rainbow含む)、DDPG/TD3、CQL、ILQL、MADDPG、MATD3、IPPO、NeuralUCB/NeuralTSに加え、長期間・多ターンタスク向けの特別なLLMファインチューニングフロー(CISPO)も提供。
  • 分散/マルチエージェント対応 – Gymnasiumのベクトル化環境とPettingZooの並列APIに対応。Arena RLOpsプラットフォームを介して多数のGPUにスケーリング可能。

使い方

# LunarLanderで単一のDQNエージェントをトレーニング
from agilerl import LocalTrainer
trainer = LocalTrainer(algorithm="DQN", environment="LunarLander-v3")
population, fitnesses = trainer.train()

進化的HPOを有効にするには、hpo=Trueを設定し、必要に応じてpop_sizeを指定します:

trainer = LocalTrainer(
    algorithm="DQN",
    environment="LunarLander-v3",
    training=TrainingSpec(pop_size=4),
    hpo=True,
)
population, fitnesses = trainer.train()

YAMLマニフェストやコマンドライン(python -m agilerl.train path/to/config.yaml)からもトレーニングを制御できます。

Arena – マネージドRLOpsサービス

  • 別途のagilerl-arenaパッケージがPython SDK(ArenaClient)とCLI(arena …)を提供。
  • これにより、カスタム環境のアップロード、トレーニングジョブの提出、クラウドGPU上のトレーニング済みエージェントのデプロイが、インフラの管理なしで可能になります。

インストール

pip install agilerl               # コアライブラリ
pip install agilerl[box2d]        # オプション:古典的制御用のBox2D物理エンジン
pip install agilerl[llm]          # LLMファインチューニング用の追加機能
pip install agilerl-arena         # Arena SDK/CLI(agilerlの基本依存関係でもある)

開発モードはpip install -e .またはpip install git+https://github.com/AgileRL/AgileRL.git@mainでサポートされています。

ドキュメントとコミュニティ

対象ユーザー ハイパーパラメータ探索やスケーリングの手間を減らしたい研究者やエンジニア、特に進化的HPOやRLによるLLMトレーニングに興味がある人向けです。


結論 – AgileRLは、幅広いアルゴリズム群と進化的ハイパーパラメータ最適化、クラウドネイティブなRLOpsプラットフォーム(Arena)を統合した本格的で活発にメンテナンスされているRLフレームワークです。RL実験をより高速かつ再現性高くするためのツールとして、真の価値を持っています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト