Farama-Foundation/MO-Gymnasium

Multi-objective Gymnasium environments for reinforcement learning

何を解決するか

マルチオブジェクティブ強化学習(MORL)アルゴリズムを開発・比較するための標準化された方法を提供します。従来、研究者は複数の報酬信号を同時に扱える一貫したAPIとベンチマーク環境が必要でしたが、単一のスカラー値に限定されていました。

動作方法

MO-Gymnasiumは標準的なGymnasium APIを拡張しています。環境とのインタラクションの基本構造は維持しつつ、報酬システムを変更しています。step関数は単一の数値ではなく、numpy配列としてベクトル化された報酬を返すようになっています。また、LinearRewardラッパーも含まれており、重みを使って複数の報酬を任意に単一のスカラー値に変換できます。

対象ユーザー

マルチオブジェクティブ強化学習に取り組む研究者や開発者で、標準環境に対してアルゴリズムのベンチマークやテストに信頼できるツールキットが必要な方々です。

特徴

  • マルチオブジェクティブ強化学習のための標準化されたAPI。
  • MORLの文献から得られた多様な環境と、MuJocoなどの古典的環境のマルチオブジェクティブ版を含む。
  • 研究の再現性を確保するための厳格な環境バージョン管理。
  • Gymnasium APIのパターンと互換性がある。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト