OpenAI の 相手の学習を認識した学習 (LOLA)
TL;DR
OpenAI は、マルチエージェント設定向けに設計された強化学習手法である Learning with Opponent-Learning Awareness (LOLA) を導入しました。LOLA は、エージェントが相手の予測される学習を積極的に形成できるようにし、Iterated Prisoners' Dilemma (IPD) のような社会的ジレンマでの協力の出現や、Repeated Matching Pennies のようなゼロサムゲームでのナッシュ均衡への収束を可能にします。
マルチエージェント RL における非定常性の課題
マルチエージェント強化学習 (MARL) では、すべてのエージェントが同時に学習しポリシーを更新するため、環境は非定常になります。この非定常性は、不安定なトレーニングや望ましくない最終結果を引き起こすことがよくあります。この課題は、ディープマルチエージェント RL、階層的 RL、高次勾配ベースの手法、および生成的対抗ネットワーク (GANs) など、幅広い設定に適用されます。
LOLA アルゴリズム: 相手の学習を形成する
Learning with Opponent-Learning Awareness (LOLA) は、エージェントの現在のポリシーが他のエージェントのパラメータ更新に与える影響を明示的に考慮する学習ルールです。環境の一部として相手を扱う代わりに、LOLA エージェントは相手の将来のパラメータ更新を予測し、その学習プロセスを形成するように自身のポリシーを最適化します。
主要な技術的実装詳細には以下が含まれます:
- パラメータ更新ルール: LOLA 更新ルールには、1 つのエージェントのポリシーが他のエージェントの予測されるパラメータ更新に与える影響を考慮する特定の項が含まれます。
- スケーラビリティ: LOLA 更新ルールは、ポリシー勾配推定器の拡張を使用して効率的に計算できます。これにより、モデルフリー RL に適した方法となり、大きなパラメータ空間、大きな入力空間、および非線形関数近似器へのスケーリングが可能になります。
パフォーマンスと結果
OpenAI 研究者は LOLA LOLA エージェントを適用し、いくつかのベンチマークで優れた性能を示しました:
- 反復囚人のジレンマ (IPD): 2 つの LOLA エージェントの遭遇では、tit-for-tat 戦略と協力の出現が見られ、独立学習エージェントではそれが行われませんでした。LOLA エージェントは、ナイーブな学習者と比較してより高いペイオフを達成し、高次勾配ベースの手法による搾取にも堅牢でした。
- 繰り返しマッチングペニーズ: このゼロサムゲームでは、LOLA エージェントはナッシュ均衡に収束しました。
- ラウンドロビントーナメント: 既存の文献からのさまざまなマルチエージェント学習アルゴリズムとのトーナメントにおいて、LOLA エージェントは IPD において最高の平均リターンを達成しました。
- グリッドワールドタスク: 埋め込まれた社会的ジレンマを特徴とするグリッドワールドタスクでは、LOLA エージェントは再帰的ポリシーと相手モデリングを使用し、自己利益から協力することを学びました。
マルチエージェントシステムへの含意
他のエージェントの学習を明示的に考慮することにより、LOLA は、個人の自己利益が通常は最適でない結果をもたらす環境において、エージェントが協力を学ぶメカニズムを提供します。このアプローチは、エージェントの視点を現在のポリシーに反応することから、代わりに同じ相手の将来の学習軌道に影響を与えることにシフトします。