OpenAIとOxfordがマルチエージェント強化学習のためのLOLAを紹介
OpenAIとオックスフォード大学は、Learning with Opponent-Learning Awareness (LOLA)を紹介しました。これは、エージェントが自身の戦略を更新する際に他のエージェントの学習プロセスを考慮できる強化学習(RL)フレームワークです。このアプローチにより、エージェントは競争的または協力的なゲームにおいて報酬的な戦略を見つけることができ、しばしば自己中心的で最適でない結果をもたらす標準的なディープRL手法の制限を克服します。
強化学習におけるマインド理論
LOLAは「マインド理論」の一形態を実装し、エージェントが自身の行動が他のエージェントの将来の行動にどのように影響するかを推論できるようにします。従来のディープマルチエージェント強化学習では、エージェントは他の学習エージェントを環境の静的な部分(木や壁のように)として扱い、他のエージェントもポリシーを適応させている事実を無視します。
LOLAは、もう一方のエージェント(たとえば「Bob」)のパラメータ更新が自身のポリシー(たとえば「Alice」)にどのように依存するかをモデル化することで区別されます。この関係を理解することで、Aliceは自身の目標にとってより有益な方法でBobの学習ステップを形作るようポリシーを更新できます。
技術的実装とパフォーマンス
LOLAのパフォーマンスの中心は、ポリシー更新プロセスに特定の数学的項を含めることです:
$$ \left(\left(\frac{\partial V^{1} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{2}}\right)^{T} \frac{\partial^{2} V^{2} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{1} \partial \theta_{i}^{2}} \cdot \delta \eta\right) $$
この項により、エージェントは他のエージェントの学習軌跡を明示的に考慮することができます。このメカニズムにより、LOLAエージェントは、Independent PPOなどの最先端のディープRL手法が失敗する環境でも成功することができます。Independent PPOエージェントは通常、他のエージェントの目的を無視した自己中心的な行動を学習しますが、LOLAエージェントは他のエージェントの目標を組み込んだ自己利益に基づいて行動し、手作業で作成されたルールや事前に設定された協力的環境を必要としません。
コインゲームと囚人のジレンマへの応用
LOLAエージェントは、反復囚人のジレンマやコインゲームなどの複雑なシナリオにおいて、効果的で報酬的な戦略を見つける能力を示しています。
コインゲームでは、赤と青の2つのエージェントがコインを拾うことを競います。どのコインでも1点を獲得しますが、反対の色のコインを拾うとエージェントに-2のペナルティが課されます。エージェントがすべてのコインを貪欲に拾うと、平均スコアはゼロになります。しかし、LOLAエージェントは自身の色のコインを主に拾うことを学習し、他のエージェントの行動を協力に向かわせることで、両者に高いスコアをもたらします。
Sources
- OriginalLearning to model other minds
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch