OpenAI 変分オプション発見アルゴリズム

OpenAIは変分推論に基づくオプション発見の新手法を導入し、特にVariational Autoencoding Learning of Options by Reinforcement(VALOR)アルゴリズムと、多様な行動モードの発見を改善するカリキュラム学習戦略を提案しています。

強化学習による変分オートエンコーディングオプション学習 (VALOR)

VALORは、変分オプション発見と変分オートエンコーダ(VAE)との間にある緊密な関係から導かれる強化学習手法です。この枠組みでは、エージェントのポリシーがエンコーダとして機能し、ノイズ分布からのコンテキストを特定の軌道へと写像します。逆に、デコーダはエージェントが生成した完全な軌道から元のコンテキストを復元するよう設計されています。

オプション安定性のためのカリキュラム学習

変分オプション発見における学習不安定性に対処するため、OpenAIはカリキュラム学習アプローチを提案します。エージェントが現在のコンテキスト集合で十分に高いパフォーマンスを示したときにのみ、エージェントが曝露されるコンテキストの数が増加します。このパフォーマンスはデコーダによって測定されます。

このカリキュラムベースのアプローチは、主に次の二つの利点を提供します:

  • トレーニングの安定化: VALORや他の既存の変分オプション発見手法のトレーニングプロセスを安定させます。
  • 行動多様性の向上: 固定されたコンテキスト分布を使用した場合よりも、単一エージェントがはるかに多くの行動モードを学習できるようにします。

研究の範囲

主要なアルゴリズム的貢献に加えて、研究は一般的な変分オプション発見アプローチの根本的な限界を調査し、学習されたオプションが下流タスクにどのように適用できるかを検証しています。

Sources