AgileRL/AgileRL

Streamlining reinforcement learning with RLOps. State-of-the-art RL algorithms and tools, with 10x faster training through evolutionary hyperparameter optimization.

What it solves

AgileRL 旨在透過引入 RLOps,簡化深度強化學習(RL)的開發,減少模型訓練與超參數優化(HPO)所需的時間與精力。它特別針對傳統 HPO 的低效率問題——往往需要上百次獨立訓練才能找到最佳設定。

How it works

此函式庫使用演化式 HPO 技術,自動收斂至最佳超參數。它不會執行多個獨立實驗,而是訓練一群共享經驗的代理人,並隨時間演化與突變其超參數。支援廣泛的 RL 範式,包括 on‑policy、off‑policy、offline、多代理人與情境式多臂賭徒問題,並提供 LocalTrainer 供快速設定,或使用名為 Arena 的受管雲平台進行分散式訓練。

Who it’s for

適用於從事強化學習的開發者與研究者,期望加快訓練週期並自動化超參數調整,免除手動的試錯過程。

Highlights

  • Evolutionary HPO:聲稱比最先進方法快 10 倍的超參數優化,因為不需要多次訓練。
  • Broad Algorithm Support:支援 PPO、DQN、Rainbow DQN、DDPG、TD3、CQL、ILQL、MADDPG、MATD3 與 IPPO。
  • LLM Fine-tuning:支援可演化的 LLM 強化微調,以應對長時程任務。
  • RLOps Platform:與 Arena 整合,提供受管雲基礎設施,用於驗證自訂環境與部署代理人。
  • Flexible Training:同時提供簡易的高階 API 與自訂訓練管線,讓使用者能完全掌控網路與突變策略。