階層強化学習のための確率的ニューラルネットワーク

階層強化学習のための確率的ニューラルネットワーク OpenAIの研究者は、スパース報酬がある下流タスクでの学習を加速する解釈可能なスキルを事前訓練するために、確率的ニューラルネットワークと情報理論的正則化器を使用したフレームワークを提案します。

階層強化学習のための確率的ニューラルネットワーク

OpenAIは、確率的ニューラルネットワークを使用して多様なスキルのセットを事前訓練し、その後下流タスクでの学習を加速するために活用する、階層強化学習(HRL)のための一般的なフレームワークを導入しました。このアプローチは、スパース報酬と長時間軸タスクの課題に特化して対処し、従来のディープ強化学習では効果的に探索することがしばしば困難である状況に対応します。

確率的ニューラルネットワークを用いたスキルの事前訓練

フレームワークの中核は、エージェントが事前訓練環境で有用なスキルを学ぶ事前訓練フェーズです。解釈可能なスキルの幅広い範囲を効率的に学ぶため、研究者は情報理論的正則化器と組み合わせた確率的ニューラルネットワークを使用します。 この事前訓練プロセスは、単一のプロキシ報酬によってガイドされます。このプロキシ報酬は、エージェントが最終的に直面する特定の下流タスクについてのドメイン知識を最小限に抑えるだけで済みます。情報理論的正則化器を使用することで、システムは学習されたスキルが互いに異なり、幅広い行動をカバーすることを保証します。

階層学習アーキテクチャ

フレームワークは、探索とサンプル効率を向上させるために階層構造で動作します:

  1. スキル獲得: エージェントはまず、事前訓練フェーズにおいて確率的ニューラルネットワークアーキテクチャを使用してスキルのライブラリを学習します。
  2. 高レベルポリシー訓練: スキルが獲得された後、これらの既存のスキルの上に高レベルポリシーが訓練されます。原始的なアクションを学ぶ代わりに、高レベルポリシーは目標を達成するために学習済みのスキルから選択します。 この階層構造により、高レベルポリシーがランダムな原始的アクションではなく、複雑で意味のある行動(スキル)を使用して環境を探索できるため、エージェントは下流タスクにおけるスパース報酬に対してより効果的に対処できるようになります。

パフォーマンスと含意

実験により、確率的ニューラルネットワークと情報理論的正則化の組み合わせが、サンプル効率の良い方法で解釈可能なスキルを学ぶのに効果的であることが示されました。研究者たちは、このアプローチが幅広い下流タスクにおいて学習性能を一様に大幅に向上させることを発見しました。 内在的動機付けと階層的手法の強みを組み合わせることで、このフレームワークは、新しいタスクごとに報酬関数を広範囲に手動で設計する必要なく、複雑な行動を学ぶスケーラブルな方法を提供します。

Sources