facebookresearch/ReAgent

A platform for Reasoning systems (Reinforcement Learning, Contextual Bandits, etc.)

何を解決するか

ReAgent は、シミュレータが利用できない大規模で分散処理が必要なタスクに特化した、実用的な強化学習(RL)の包括的プラットフォームを提供します。バッチデータ上でポリシーをオフラインで学習し、リアルワールド環境に安全にデプロイする課題に対処します。

動作方法

Python と PyTorch で構築され、モデルのサービングには TorchScript を使用します。データ前処理、特徴変換、分散学習、最適化されたサービングを含む、ディープRLの完全なワークフローを統合しています。シミュレータが存在しない状況に対応するため、オフポリシーアルゴリズムに焦点を当て、新しいポリシーの性能をデプロイせずに推定するための反事実的ポリシー評価(CPE)を活用しています。

対象ユーザー

大規模な最適化および推薦システムの開発者や研究者で、オフラインRL学習と安全なポリシーのデプロイが必要な方々を対象としています。

主な特徴

  • 幅広いアルゴリズム対応: 伝統的なオフポリシーアルゴリズム(DQN、TD3、SAC、PPO)、推薦システム向けRL(Seq2Slate、SlateQ)、マルチアーム/コンテキストバンドイットを含む。
  • 反事実評価: Doubly Robust や MAGIC などの技術を実装し、ポリシーをオフラインで評価可能。
  • リアルワールド応用ツール: 特徴の重要性を分析するためのドメイン分析ツールと、安全にポリシー学習を開始するための行動クラッシング機能を備える。
  • エンドツーエンドのワークフロー: データ前処理から分散学習、モデルサービングまでをカバー。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch