Neural MMO: マルチエージェント大規模ゲーム環境
OpenAIは、強化学習(RL)研究のために設計された、大規模マルチエージェントゲーム環境であるNeural MMOを発表しました。このプラットフォームは、持続的でオープンエンドなタスクの中で、多数かつ可変数のエージェントが相互作用できるようにし、多数のエージェントと種の組み込みが探索の向上、ニッチの発散的形成、および全体的な能力の向上につながることを示しています。
Neural MMOのコア設計原則
Neural MMOは、複雑だが狭い環境と、オープンエンドだが単純な環境の間のギャップを埋めるために構築されています。以下の4つの主要な基準を満たしています:
- Persistence(永続性): エージェントは環境のリセットなしで同時に学習します。これにより、長期的な時間枠を考慮した戦略が必要となり、他のエージェントの進化する行動に適応する必要があります。
- Scale(スケール): 環境は巨大な人口をサポートします。OpenAIの実験では、128の同時エージェントがそれぞれ100の同時サーバーで最大1億ライフタイムを含んでいました。
- Efficiency(効率性): プラットフォームは低い計算コストで設計されており、単一のデスクトップCPUでも効果的なポリシーを訓練できます。
- Expansion(拡張性): 環境はオープンソースでの拡張を想定して設計されています。現在の機能には、プロシージャルタイルベースの地形、食料と水の採取システム、戦略的な戦闘システムが含まれます。
環境のメカニクスとエージェントの相互作用
エージェントは、設定可能なサイズの自動生成タイルベースマップ上で動作します。環境にはいくつかの生存と戦闘メカニクスが組み込まれています:
- Survival(生存): エージェントは食料と水を得て体力を維持しなければなりません。水は無限の水タイルから得られ、食料は森林タイルから得られますが、供給は限られており、時間の経過とともにゆっくりと再生されます。
- Combat(戦闘): プレイヤーは3つの異なるスタイル—Melee(近接)、Range(遠距離)、Mage(魔法)—を使って戦闘を行います。
- Input/Output(入力/出力): エージェントは自分の位置を中心としたタイルの正方形クロップを受け取り、地形タイプおよび他のエージェントのプロパティ(体力、食料、水、位置)を含みます。各ゲームティックで、エージェントは1つの移動アクションと1つの攻撃アクションを出力します。
モデルアーキテクチャとトレーニング
OpenAIは、バニラポリシー勾配で訓練された小さな全結合アーキテクチャを使用し、価値関数ベースラインと報酬の割引を利用しました。
特定の目的への報酬ではなく、エージェントは単純に自身のライフタイム(軌道長)を最適化し、生存している毎ティックに対して報酬1を受け取ります。可変長の観測(周囲のプレイヤーの数など)を扱うために、モデルはすべてのプレイヤーのうち最大値を取って単一長のベクトルを作成します。
実装はPyTorchとRayを使用して構築されています。
評価結果と主要な発見
OpenAIは、「サーバーマージトーナメント」と呼ばれる手法でエージェントの能力を評価しました。異なるサーバーからのプレイヤーベースを単一の環境にマージし、異なる設定下で学習されたポリシーを比較します。
マルチエージェント相互作用が能力を拡大
より大きな設定で訓練されたエージェントは、より小さな設定で訓練されたエージェントを常に上回ります。研究によると、エージェントの能力はマルチエージェント相互作用のレベルに直接比例してスケールします。
人口サイズが探索を促進
人口サイズの増加は、資源競争を避けるためにマップ全体にエージェントを広げるインセンティブとなります。同時エージェントの数が増えるにつれてマップカバレッジが増加し、エージェントは他の存在に対する自然な反応として探索を学習します。
種の数がニッチ形成を促進
人口(種)の数を増やすとニッチ形成が起こります。エージェントは同じ重みを共有する自分の集団内の他者に勝てないため、十分な資源を見つけて自分の集団を維持できるマップの異なる領域を探し求めます。これにより、異なる集団がマップ上で離れて競争を避けるようになります。
空間的価値分布
2番目のエージェントの位置に対する価値関数を可視化することで、OpenAIはエージェントが複雑な空間依存関係を発達させることを発見しました:
- Foraging(採取): エージェントは素早く「的の中心」回避マップを学習し、採取をより効果的に行います。
- Combat(戦闘): エージェントが戦闘メカニクスを習得するにつれて、他のエージェントのポリシーに基づいて特定の交戦範囲と接近角度を価値あるものとして学習します。