AgileRL/AgileRL
Streamlining reinforcement learning with RLOps. State-of-the-art RL algorithms and tools, with 10x faster training through evolutionary hyperparameter optimization.
AgileRL – 내장형 RLOps를 갖춘 강화학습 라이브러리
무엇인가요 – AgileRL은 최신 강화학습(RL) 알고리즘(온폴리시, 오프폴리시, 오프라인, 다중 에이전트, 밴디트, LLM 파인튜닝 등)을 통합한 오픈소스 파이썬 라이브러리입니다. 또한 진화적 하이퍼파라미터 최적화(HPO)와 분산 학습을 위한 도구 세트도 제공합니다. 개발자들은 이 조합을 RLOps라고 부르며, RL 워크로드에 대한 MLOps의 유사물이라고 설명합니다.
주요 아이디어
- 진화적 HPO – 수십 개의 별도 실험을 수행하는 대신 AgileRL은 에이전트 집단을 진화시켜, 수천 단계마다 하이퍼파라미터와 네트워크 아키텍처를 변이시킵니다. README에 따르면 기존 Optuna 기반 파이프라인보다 최대 10배 빠른 HPO를 제공한다고 합니다.
- 모듈식 트레이너 –
LocalTrainer(단일 머신용)와 클라우드 플랫폼 Arena의 SDK/CLI를 통해 단일 에이전트, 집단, 또는 사용자 정의 파이프라인을 학습할 수 있습니다. - 광범위한 알고리즘 커버리지 – PPO, DQN(Rainbow 포함), DDPG/TD3, CQL, ILQL, MADDPG, MATD3, IPPO, NeuralUCB/NeuralTS에 더해, 장기적이고 다단계 작업을 위한 특별한 LLM 파인튜닝 흐름(CISPO)도 제공합니다.
- 분산/다중 에이전트 지원 – Gymnasium 벡터화 환경과 PettingZoo 병렬 API와 호환되며, Arena RLOps 플랫폼을 통해 수많은 GPU에 스케일링 가능합니다.
사용 방법
# LunarLander에서 단일 DQN 에이전트 학습
from agilerl import LocalTrainer
trainer = LocalTrainer(algorithm="DQN", environment="LunarLander-v3")
population, fitnesses = trainer.train()
진화적 HPO를 사용하려면 hpo=True를 활성화하고, 필요에 따라 pop_size를 설정합니다:
trainer = LocalTrainer(
algorithm="DQN",
environment="LunarLander-v3",
training=TrainingSpec(pop_size=4),
hpo=True,
)
population, fitnesses = trainer.train()
YAML 매니페스트나 명령줄(python -m agilerl.train path/to/config.yaml)을 통해도 학습을 제어할 수 있습니다.
Arena – 관리형 RLOps 서비스
- 별도의
agilerl-arena패키지가 Python SDK(ArenaClient)와 CLI(arena …)를 제공합니다. - 이를 통해 사용자 정의 환경을 업로드하고, 학습 작업을 제출하며, 인프라를 직접 관리하지 않고도 클라우드 GPU에 학습된 에이전트를 배포할 수 있습니다.
설치
pip install agilerl # 핵심 라이브러리
pip install agilerl[box2d] # 선택적 Box2D 물리 엔진 (고전적 제어용)
pip install agilerl[llm] # LLM 파인튜닝 추가 기능
pip install agilerl-arena # Arena SDK/CLI (agilerl의 기본 종속성)
개발 모드는 pip install -e . 또는 pip install git+https://github.com/AgileRL/AgileRL.git@main로 지원됩니다.
문서 및 커뮤니티
- 전체 문서는 https://docs.agilerl.com (단일 에이전트, 다중 에이전트, 밴디트, 커리큘럼 학습, 사용자 정의 네트워크, LLM 파인튜닝 튜토리얼 포함)
- 디스코드 서버와 온라인 벤치마크 페이지에서는 HPO에서 최대 10배의 속도 향상과 최첨단 LLM 파인튜닝 성능을 확인할 수 있습니다.
누구를 위한가요 하이퍼파라미터 탐색과 확장성 문제를 줄이고 싶은 연구자나 엔지니어, 특히 진화적 HPO나 RL을 이용한 LLM 학습에 관심 있는 분들께 적합합니다.
결론 – AgileRL은 광범위한 알고리즘 세트와 진화적 하이퍼파라미터 최적화, 클라우드 네이티브 RLOps 플랫폼(Arena)을 결합한 진정한, 활발히 유지보수되는 RL 프레임워크입니다. RL 실험을 더 빠르고 재현 가능하게 만드는 데 목적이 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트