Farama-Foundation/MPE2

A set of communication oriented environments

何を解決するか

MPE2 は、マルチエージェント強化学習(MARL)アルゴリズムの訓練およびテスト用に、通信志向のシミュレーション環境を提供します。協力的および敵対的な設定の両方で、エージェントがタスクを達成するために相互作用、通信、協調を学ぶ必要がある、標準化され、軽量な環境の必要性に対応しています。

仕組み

このプロジェクトは、エージェントが円として表現され、他のエージェントを視認し、静的なランドマークと相互作用できる「粒子」環境のシリーズを実装しています。離散(デフォルト)および連続アクション空間の両方をサポートしており、エージェントは基本的な方向への移動制御や、通信チャネルを介したメッセージのブロードキャストが可能です。システムは、位置、速度、受信したメッセージといった観測値と、オブジェクトを押す、他のエージェントをタグするなどの目標達成度に基づいた報酬を追跡します。

対象ユーザー

マルチエージェントAIの研究者および開発者向けです。特に、強化学習における出現的通信、協調、競争的/協力的ゲーム理論に注力している方々に適しています。

特徴

  • 多様な相互作用モデル:協力的環境(例:Simple Spread、Simple Formation)と敵対的環境(例:Simple Tag、Simple Push)を含みます。
  • 柔軟なアクション空間:移動および通信の両方で離散的および連続的制御をサポートします。
  • 通信チャネル:エージェントが行動を調整するためにメッセージをブロードキャストおよび受信するための組み込みメカニズムがあります。
  • 改善された安定性:OpenAIの元のMPEに基づいていますが、報酬の一貫性および離散アクション空間のデフォルト設定に修正を加えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト