AgileRL/AgileRL
Streamlining reinforcement learning with RLOps. State-of-the-art RL algorithms and tools, with 10x faster training through evolutionary hyperparameter optimization.
AgileRL – ビルトインRLOpsを備えた強化学習ライブラリ
何であるか – AgileRLは、最新の強化学習(RL)アルゴリズム(オンポリシー、オフポリシー、オフライン、マルチエージェント、バンディット、LLMファインチューニングなど)を統合したオープンソースのPythonライブラリです。さらに、進化的ハイパーパラメータ最適化(HPO)と分散トレーニングのためのツールセットも提供します。開発者たちはこの組み合わせをRLOpsと呼んでおり、RLワークロードにおけるMLOpsの類似物です。
主なアイデア
- 進化的HPO – 数十もの独立した実験を実行するのではなく、AgileRLはエージェントの集団を進化させ、数千ステップごとにハイパーパラメータとネットワークアーキテクチャを変異させます。READMEによると、従来のOptunaベースのパイプラインと比べて最大10倍速いHPOが可能とされています。
- モジュール式トレーナー –
LocalTrainer(単一マシン用)とクラウドプラットフォームArenaのSDK/CLIにより、単一エージェント、集団、またはカスタムパイプラインのトレーニングが可能です。 - 広範なアルゴリズムカバレッジ – PPO、DQN(Rainbow含む)、DDPG/TD3、CQL、ILQL、MADDPG、MATD3、IPPO、NeuralUCB/NeuralTSに加え、長期間・多ターンタスク向けの特別なLLMファインチューニングフロー(CISPO)も提供。
- 分散/マルチエージェント対応 – Gymnasiumのベクトル化環境とPettingZooの並列APIに対応。Arena RLOpsプラットフォームを介して多数のGPUにスケーリング可能。
使い方
# LunarLanderで単一のDQNエージェントをトレーニング
from agilerl import LocalTrainer
trainer = LocalTrainer(algorithm="DQN", environment="LunarLander-v3")
population, fitnesses = trainer.train()
進化的HPOを有効にするには、hpo=Trueを設定し、必要に応じてpop_sizeを指定します:
trainer = LocalTrainer(
algorithm="DQN",
environment="LunarLander-v3",
training=TrainingSpec(pop_size=4),
hpo=True,
)
population, fitnesses = trainer.train()
YAMLマニフェストやコマンドライン(python -m agilerl.train path/to/config.yaml)からもトレーニングを制御できます。
Arena – マネージドRLOpsサービス
- 別途の
agilerl-arenaパッケージがPython SDK(ArenaClient)とCLI(arena …)を提供。 - これにより、カスタム環境のアップロード、トレーニングジョブの提出、クラウドGPU上のトレーニング済みエージェントのデプロイが、インフラの管理なしで可能になります。
インストール
pip install agilerl # コアライブラリ
pip install agilerl[box2d] # オプション:古典的制御用のBox2D物理エンジン
pip install agilerl[llm] # LLMファインチューニング用の追加機能
pip install agilerl-arena # Arena SDK/CLI(agilerlの基本依存関係でもある)
開発モードはpip install -e .またはpip install git+https://github.com/AgileRL/AgileRL.git@mainでサポートされています。
ドキュメントとコミュニティ
- 完全なドキュメントは https://docs.agilerl.com(単一エージェント、マルチエージェント、バンディット、カリキュラム学習、カスタムネットワーク、LLMファインチューニングのチュートリアル付き)
- Discordサーバーとオンラインベンチマークページでは、HPOで最大10倍の高速化と最先端のLLMファインチューニング結果を紹介しています。
対象ユーザー ハイパーパラメータ探索やスケーリングの手間を減らしたい研究者やエンジニア、特に進化的HPOやRLによるLLMトレーニングに興味がある人向けです。
結論 – AgileRLは、幅広いアルゴリズム群と進化的ハイパーパラメータ最適化、クラウドネイティブなRLOpsプラットフォーム(Arena)を統合した本格的で活発にメンテナンスされているRLフレームワークです。RL実験をより高速かつ再現性高くするためのツールとして、真の価値を持っています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト