facebookresearch/ReAgent
A platform for Reasoning systems (Reinforcement Learning, Contextual Bandits, etc.)
해결하는 문제
ReAgent는 시뮬레이터가 없는 대규모 분산 작업을 위해 특별히 설계된 실용적 강화학습(RL)을 위한 완전한 플랫폼을 제공합니다. 데이터 배치를 기반으로 정책을 오프라인에서 학습하고, 실제 환경에 안전하게 배포하는 과제를 해결합니다.
작동 방식
Python과 PyTorch로 구축되었으며, 모델 서빙에는 TorchScript를 사용합니다. 데이터 전처리, 특징 변환, 분산 학습, 최적화된 서빙을 포함하는 딥 RL의 완전한 워크플로우를 통합합니다. 시뮬레이터가 없는 상황을 고려해, 오프폴리시 알고리즘에 초점을 맞추고, 새로운 정책을 먼저 배포하지 않고도 성능을 추정하기 위해 반사적 정책 평가(CPE)를 사용합니다.
대상 사용자
대규모 최적화 및 추천 시스템을 개발하거나 연구하는 개발자 및 연구자로, 오프라인 RL 학습과 안전한 정책 배포가 필요한 분들을 대상으로 합니다.
주요 특징
- 광범위한 알고리즘 지원: 전통적인 오프폴리시 알고리즘(DQN, TD3, SAC, PPO), 추천 시스템용 RL(Seq2Slate, SlateQ), 다중 암/컨텍스트 밴디트를 포함합니다.
- 반사적 평가: Doubly Robust 및 MAGIC와 같은 기법을 구현하여 정책을 오프라인에서 평가할 수 있습니다.
- 실제 적용 도구: 특성 중요도 분석을 위한 도메인 분석 도구와 안전하게 정책 학습을 시작할 수 있는 행동 클론 기능을 제공합니다.
- 엔드투엔드 워크플로우: 데이터 전처리에서 분산 학습, 모델 서빙에 이르기까지 모든 과정을 커버합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch