facebookresearch/ReAgent
A platform for Reasoning systems (Reinforcement Learning, Contextual Bandits, etc.)
解决的问题
ReAgent 提供了一个完整的应用强化学习(RL)平台,专为大规模分布式任务设计,且无需模拟器。它解决了在数据批次上离线训练策略,并安全部署到真实环境中的挑战。
工作原理
基于 Python 和 PyTorch 构建,模型服务使用 TorchScript。平台整合了深度强化学习的完整工作流,包括数据预处理、特征转换、分布式训练和优化服务。为应对缺乏模拟器的情况,它专注于离策略算法,并使用反事实策略评估(CPE)来估计新策略的性能,而无需先部署。
适用人群
适用于需要离线强化学习训练和安全策略部署的大规模优化与推荐系统领域的开发者和研究人员。
主要亮点
- 广泛的算法支持:包含经典离策略算法(DQN、TD3、SAC、PPO)、推荐系统强化学习(Seq2Slate、SlateQ)以及多臂/上下文Bandits。
- 反事实评估:实现 Doubly Robust 和 MAGIC 等技术,用于离线评估策略。
- 真实世界应用工具:提供领域分析工具以分析特征重要性,以及行为克隆功能,可安全地启动策略学习。
- 端到端工作流:涵盖从数据预处理到分布式训练和模型服务的全部流程。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch