OpenAI Parameter Noise による探索の向上

OpenAI は、強化学習 (RL) アルゴリズムのパラメータに適応的なノイズを加えることで、パフォーマンスが向上し、学習プロセスが加速されることが多いことを示しました。この手法は、従来の行動空間におけるノイズよりも一貫性のある探索形態を提供するため、さまざまな RL 問題に対して汎用性の高い追加要素となります。

Parameter Noise vs. Action Space Noise

Parameter noise は、エージェントのニューラルネットワーク・ポリシーのパラメータに直接ランダム性を注入することで、エージェントの決定が現在の感覚入力に完全に依存し続けることを保証します。これは、従来の RL の探索とは以下の点で異なります。

  • Action Space Noise: 従来の RL は、ある瞬間から次の瞬間にかけて行動の可能性を変化させ、エージェントの特定のパラメータとは相関のない予測不可能な探索をもたらします。
  • Parameter Space Noise: パラメータ自体を変更することで、エージェントの探索は異なるタイムステップ間で一貫性を持ち、より洗練された行動と高いスコアにつながります。

このアプローチは、ロールアウト中の行動に影響を与えずにポリシー・パラメータを操作する進化戦略と、通常は行動空間にノイズを加える TRPO、DQN、DDPG のような深層 RL アプローチの中間的な役割を果たします。

Continuous Control におけるパフォーマンスの向上

Parameter noise を使用すると、エージェントは従来の手法よりも迅速にタスクをマスターできます。HalfCheetah Gym 環境において、parameter noise で訓練されたポリシーは 20 エピソード後に約 3,000 のスコアを達成しましたが、従来の action noise を使用したポリシーは約 1,500 のスコアにしか達しませんでした。

技術的な実装と課題

OpenAI は、深層ニューラルネットワークに parameter noise を適用する際に 3 つの主要な課題を特定し、それぞれに対して特定の技術的な解決策を実装しました。

1. Layer Sensitivity

ネットワークの層によって、摂動に対する感度が異なります。OpenAI は、摂動を受けた層の出力が次の層の入力になる前に、同様の分布内に留まるようにするために layer normalization を利用しました。

2. Weight Sensitivity and Predictability

ポリシーの重みの感度が訓練中に変化し、行動予測を困難にすることがあります。OpenAI は、パラメータ空間における摂動の大きさを、それが行動空間に与える影響を測定することで調整する adaptive scheme を導入しました。

3. Noise Scale Selection

パラメータ空間における正しいノイズ・スケールを選択することは直感的ではありません。適応的なスキームは、この問題をノイズ・スケールの選択という課題から、研究者にとってより解釈可能な action space への問題へと移行させることで、これを解決します。

Algorithm Compatibility and Baselines

OpenAI は、parameter noise の使用を on-policy と off-policy の両方のアルゴリズムに拡張しました。この手法を取り入れたベースライン・コードは、以下のアルゴリズムに対してリリースされています。

  • DQN
  • Double DQN
  • Dueling DQN
  • Dueling Double DQN
  • DDPG

これらの実装のベンチマークには、Atari ゲームのサブセットにおける DDQN のパフォーマンスと、Mujoco シミュレータにおけるさまざまな continuous control タスクにおける 3 つの DDPG バリアントが含まれます。

DQN 実装に関する開発の洞察

開発の初期段階において、OpenAI は極端な摂動がアルゴリズムに同じ行動を繰り返させる原因となるのを防ぐため、DQN に個別のポリシー・ヘッドを追加しました。しかし、その後の実験により、この個別のヘッドは不要であることが判明しました。ノイズの再スケーリング方法を改良することで、チームはよりシンプルでコストの低い実装で同様の結果を得ることができました。OpenAI は、これが強化学習における一般的な問題、すなわちアルゴリズムが「静かに、かつ微妙に失敗する」ことがあり、開発者がバグをより単純に解決できるはずのものを、複雑なソリューションを設計してしまう可能性があることを強調しています。

Sources