OpenAI ランダムネットワーク蒸留 (RND) 強化学習用
OpenAI は Random Network Distillation (RND) を開発しました。これは予測に基づく手法で、強化学習 (RL) エージェントが好奇心を通じて環境を探索することを促します。このアプローチは、固定されたランダムニューラルネットワークの出力を予測する難易度に基づいて報酬を与えることで、エージェントが未踏の状態を訪れることを可能にします。初めて、この手法は Atari ゲーム『Montezuma's Revenge』において平均的な人間のパフォーマンスを上回り、最先端の性能を達成し、時には人間のデモンストレーションや基盤となるエミュレータ状態へのアクセスなしで、すべての 24 部屋を見つけて第一レベルを解くことさえできました。
ランダムネットワーク蒸留 (RND) 技術概要
ランダムネットワーク蒸留は、未踏の状態の探索を奨励するよう設計されています。システムは固定されたランダムに初期化されたニューラルネットワークをターゲットとして使用します。2 番目のネットワークである予測器は、次の状態が与えられたときにこのターゲットネットワークの出力を予測しようとします。
予測器ネットワークはエージェントが訪れる状態で訓練されるため、頻繁に訪れる状態では予測誤差が低く、未知の状態では高くなります。この予測誤差が内在的報酬として機能し、エージェントを環境の未探索領域へと駆り立てます。
ノイズTV問題の解決
従来の次状態予測に基づく好奇心駆動型手法は「ノイズTV問題」に陥りやすく、エージェントが環境の確率的要素(例としてランダムなノイズを放つテレビ)に捕らわれ、常に予測不可能であるため高い内在的報酬を得続けてしまいます。
RND は、環境そのものの次状態を予測するのではなく、決定論的な合成問題(固定されたランダムネットワーク)の出力を予測することに焦点を当てることでこの問題を排除します。これにより、予測誤差は確率性ではなく新規性によって引き起こされ、RND はノイズTV問題に対して免疫を持ちます。
Montezuma's Revenge における性能
Montezuma's Revenge は、シンプルな探索戦略では報酬を得られないことが多いため、RL における探索のベンチマークと広く見なされています。元の DQN 論文では、エージェントが平均的な人間スコアの 0%(4.7K)しか達成できなかった唯一のゲームでした。
RND を使用して、OpenAI は以下の結果を達成しました:
- 大規模実験: 1024 のロールアウトワーカーを使用し、エージェントは 9 回の実行で平均リターン 10K を達成し、最高平均リターンは 14.5K でした。ほとんどの実行で 20〜22 部屋が発見されました。
- 長期実験: 10 回のうち 1 回が最高リターン 17.5K を達成し、これは第一レベルをクリアし、すべての 24 部屋を見つけたことに相当します。
環境横断的な好奇心駆動学習
OpenAI は 50 以上の異なる環境で、環境固有の(外的)報酬を一切使用しない大規模な研究を実施しました。エージェントはさまざまなレベルの能力を示しました:
- スーパーマリオブラザーズ: エージェントは 11 レベルを発見し、隠し部屋を見つけ、ボスを倒しました。内在的報酬がゲームの進行という目的とよく合致していたためです。
- ボウリング: エージェントはクリップされた外的報酬で訓練されたエージェントを上回りました。おそらく、ストライク後のスコアボードの予測不可能な点滅に惹かれたためです。
- ポン: エージェントはラリーを長く続けるためにボールをプレイし続けることを学びましたが、勝つことよりもゲームを長く続けることを優先しました。
- ブレイクアウト: エージェントは新しいブロック配置に遭遇したり、レベルを初めてクリアしたりすると、内在的報酬が急上昇することを経験しました。
実装と学習の安定性
OpenAI は、実装の詳細が RND の成功にとって重要であると指摘しています。安定性は、特徴の飽和を回避し、内在的報酬を予測可能な範囲に収めることで達成されました。チームは、バグが修正されるたびに大幅な性能向上が見られ、よりシンプルなアルゴリズムがデバッグや安定性の面で好まれることを強調しました。
探索ボーナスと外的報酬を統合するために、OpenAI は 2 つの報酬ストリーム用に別々の価値ヘッドを持つ Proximal Policy Optimization (PPO) の変種を使用しました。これにより、異なる割引率やエピソード型と非エピソード型のリターンの組み合わせが可能になります。