facebookresearch/ReAgent
A platform for Reasoning systems (Reinforcement Learning, Contextual Bandits, etc.)
何を解決するか
ReAgent は、シミュレータが利用できない大規模で分散処理が必要なタスクに特化した、実用的な強化学習(RL)の包括的プラットフォームを提供します。バッチデータ上でポリシーをオフラインで学習し、リアルワールド環境に安全にデプロイする課題に対処します。
動作方法
Python と PyTorch で構築され、モデルのサービングには TorchScript を使用します。データ前処理、特徴変換、分散学習、最適化されたサービングを含む、ディープRLの完全なワークフローを統合しています。シミュレータが存在しない状況に対応するため、オフポリシーアルゴリズムに焦点を当て、新しいポリシーの性能をデプロイせずに推定するための反事実的ポリシー評価(CPE)を活用しています。
対象ユーザー
大規模な最適化および推薦システムの開発者や研究者で、オフラインRL学習と安全なポリシーのデプロイが必要な方々を対象としています。
主な特徴
- 幅広いアルゴリズム対応: 伝統的なオフポリシーアルゴリズム(DQN、TD3、SAC、PPO)、推薦システム向けRL(Seq2Slate、SlateQ)、マルチアーム/コンテキストバンドイットを含む。
- 反事実評価: Doubly Robust や MAGIC などの技術を実装し、ポリシーをオフラインで評価可能。
- リアルワールド応用ツール: 特徴の重要性を分析するためのドメイン分析ツールと、安全にポリシー学習を開始するための行動クラッシング機能を備える。
- エンドツーエンドのワークフロー: データ前処理から分散学習、モデルサービングまでをカバー。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch