AgileRL/AgileRL

Streamlining reinforcement learning with RLOps. State-of-the-art RL algorithms and tools, with 10x faster training through evolutionary hyperparameter optimization.

What it solves

AgileRL 旨在通过引入 RLOps,简化深度强化学习(RL)的开发,减少模型训练与超参数优化(HPO)所需的时间与精力。它特别针对传统 HPO 的低效率问题——往往需要上百次独立训练才能找到最佳设置。

How it works

此库使用进化式 HPO 技术,自动收敛到最佳超参数。它不会运行多个独立实验,而是训练一群共享经验的代理人,并随时间演化和突变其超参数。支持广泛的 RL 范式,包括 on‑policy、off‑policy、offline、多代理人以及情境式多臂赌博机问题,并提供 LocalTrainer 供快速设置,或使用名为 Arena 的受管云平台进行分布式训练。

Who it’s for

适用于从事强化学习的开发者和研究者,期望加快训练周期并自动化超参数调优,免除手动的试错过程。

Highlights

  • Evolutionary HPO:声称比最先进方法快 10 倍的超参数优化,因为不需要多次训练。
  • Broad Algorithm Support:支持 PPO、DQN、Rainbow DQN、DDPG、TD3、CQL、ILQL、MADDPG、MATD3 与 IPPO。
  • LLM Fine-tuning:支持可进化的 LLM 强化微调,以应对长时程任务。
  • RLOps Platform:与 Arena 整合,提供受管云基础设施,用于验证自定义环境与部署代理人。
  • Flexible Training:同时提供简易的高级 API 与自定义训练管线,让用户能完全掌控网络与突变策略。