単一のデモンストレーションからMontezuma’s Revengeを学ぶ

OpenAIは、AtariゲームMontezuma’s Revengeで74,500点という高得点を達成できる強化学習(RL)エージェントを開発し、これまでに公表されたすべての結果を上回りました。このエージェントは、近接方策最適化(PPO)を用いてゲームスコアを最適化し、単一の人間デモンストレーションを活用してスパース報酬環境における探索の固有の困難を回避しています。

スパース報酬ゲームにおける探索問題

強化学習エージェントは、報酬を見つけるためにランダム探索に依存するため、Montezuma’s Revengeのようなゲームで通常苦労します。報酬が希少で、長く正確な行動シーケンスが必要な環境では、ランダムに報酬にたどり着く確率はシーケンスの長さに対して指数的に増加します(exp(N)).

例えば、Montezuma’s Revengeで最初の鍵を取得するには、はしごを降り、ロープを渡り、障害物をジャンプで越えるという特定の行動シーケンスが必要です。成功の総確率は各個別行動の確率の積であり、ランダムエージェントが成功する可能性は極めて低くなります。

デモンストレーションベースのカリキュラムによる探索の簡素化

探索問題を解決するために、OpenAIは人間デモンストレーションを使用してサブタスクのカリキュラムを構築し、探索と学習を分離しました。ゲームの開始からすべてのエピソードを始める代わりに、エージェントはデモンストレーション内で慎重に選ばれた状態から開始します。

逆カリキュラムプロセス

エージェントは逆順の学習プロセスに従います:

  1. End-State Initialization: エージェントは人間デモンストレーションの終端付近からエピソードを開始して訓練を開始します。
  2. Incremental Regression: エージェントが残りのゲーム部分でデモンストレーターのスコアを少なくとも20%のロールアウトで上回るか同等にできるようになると、開始点を時間的に遡らせます。
  3. Full Game Mastery: このプロセスは、エージェントがゲームの最初から開始して独立して目標に到達できるようになるまで続きます。

このアプローチは指数的な探索問題を、行動数(N)に比例した線形スケールの問題に変換し、RL問題を動的計画法の形として扱えるようにします。

模倣学習との比較

模倣ベースのアプローチ(デモンストレーションから特定の状態や行動を模倣させる)とは異なり、OpenAIの手法はゲームスコアを直接最適化します。この違いは以下の利点をもたらします:

  • Avoids Overfitting: エージェントは潜在的に最適でない人間デモンストレーションに縛られません。
  • Performance Optimization: エージェントは人間デモンストレーターが考慮しなかった新しい解決策を発見できます。
  • Versatility: この手法は、特定のプレイヤーを単に模倣するのではなく、対戦相手を上回ることが目的のマルチプレイヤーゲームにより適しています。

技術的課題と一般化

探索を簡素化したにもかかわらず、エージェントは以下の技術的ハードルに直面します:

状態の一般化

エージェントはフレームスキップの違いや行動の固有のランダム性により、デモンストレーションと完全に同一の状態に到達できないことがよくあります。そのため、エージェントは非常に似ているが同一ではない状態間で一般化できなければなりません。これはMontezuma’s Revengeでは機能しましたが、GravitarやPitfallといったゲームでは視覚的課題がより困難であるため、効果が低下しました。

ハイパーパラメータ調整

高得点を達成するには、PPOのエントロピー・ボーナス係数、学習率、報酬スケーリングを精密に調整する必要がありました。アルゴリズムは依然として大きなランダム変動を示し、いくつかの実行は収束に失敗しました。

ロバスト性と摂動

一般化をテストするために、OpenAIはポリシーに対して以下の摂動を加えました:

  • Sticky Actions: 最後の行動を0.25の確率で繰り返すと、平均スコアは10,000点になりました。
  • Random Actions: 0.01の確率でランダム行動を導入すると、平均スコアは8,400点になりました。

これらの摂動はスコアを低下させますが、結果は依然として過去に公表されたベンチマークを上回ります。

Sources