Farama-Foundation/MO-Gymnasium
Multi-objective Gymnasium environments for reinforcement learning
何を解決するか
マルチオブジェクティブ強化学習(MORL)アルゴリズムを開発・比較するための標準化された方法を提供します。従来、研究者は複数の報酬信号を同時に扱える一貫したAPIとベンチマーク環境が必要でしたが、単一のスカラー値に限定されていました。
動作方法
MO-Gymnasiumは標準的なGymnasium APIを拡張しています。環境とのインタラクションの基本構造は維持しつつ、報酬システムを変更しています。step関数は単一の数値ではなく、numpy配列としてベクトル化された報酬を返すようになっています。また、LinearRewardラッパーも含まれており、重みを使って複数の報酬を任意に単一のスカラー値に変換できます。
対象ユーザー
マルチオブジェクティブ強化学習に取り組む研究者や開発者で、標準環境に対してアルゴリズムのベンチマークやテストに信頼できるツールキットが必要な方々です。
特徴
- マルチオブジェクティブ強化学習のための標準化されたAPI。
- MORLの文献から得られた多様な環境と、MuJocoなどの古典的環境のマルチオブジェクティブ版を含む。
- 研究の再現性を確保するための厳格な環境バージョン管理。
- Gymnasium APIのパターンと互換性がある。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト