OpenAI の階層学習リサーチ
OpenAI は、Meta-Learning Shared Hierarchies (MLSH) を導入しました。これは、数千のタイムステップを必要とするタスクを、高レベルのアクションを自動的に発見することで解決するように設計された階層型強化学習アルゴリズムです。このアプローチにより、エージェントは学習したコンポーネントをシーケンス化することで、低レベルのアクションでの総当たり検索に頼ることなく、新しい複雑なナビゲーションタスクを素早く習得できます。
長時間的タスクの課題
従来の強化学習手法は、しばしば低レベルのアクションでの総当たり検索に依存します。これは、タスクが多数のタイムステップを必要とする場合、非常に非効率的になります。たとえば、2,000 の低レベルアクションを必要とする解決策は、単純な試行錯誤で解くには計算コストが高くなります。
MLSH は、複雑な振る舞いを高レベルのアクションの短いシーケンスとして表現することでこの問題に対処します。2,000 ステップの低レベルシーケンスを 10 ステップの高レベルシーケンスに削減することにより、エージェントははるかに効率的に解決策を探索できます。
Meta-Learning Shared Hierarchies (MLSH) アーキテクチャ
MLSH は、マスターポリシーとサブポリシーのセットからなる階層ポリシーを実装します。マスターポリシーは、$N$ ステップごと($N$ は 200 の可能性があります)に高レベルのアクションを選択し、選択されたサブポリシーはその後、その $N$ ステップの間実行されます。
MLSH の主要な技術的特徴は次のとおりです:
- 自動発見: 以前の手作業で設計された階層ポリシーとは異なり、MLSH は環境との相互作用を通じて階層構造を自動的に発見します。
- メタ学習の視点: このアルゴリズムは、「good」階層とは、これまで見たことのないタスクでのトレーニング時に、エージェントが素早く高い報酬を達成できるものであると定義します。
- 共有サブポリシー: エージェントはタスクの分布で訓練されます。マスターポリシーはサンプリングされた各タスクごとに新たに学習されますが、サブポリシーはタスク間で共有され、これによりエージェントは汎用的な高レベルアクションのセットを洗練させることができます。
AntMaze における実験結果
アルゴリズムを評価するために、OpenAI の研究者は、9 つの異なる迷路の分布をナビゲートする MuJoCo Ant ロボットを特徴とする AntMaze 環境を使用しました。
環境との相互作用を通じて、MLSH は歩行やさまざまな方向への這い回りといった具体的な多様なサブポリシーのセットを正常に発見しました。これらはシーケンス化して迷路タスクを解決することができます。研究者たちは、このサブポリシーのセットにより、エージェントが元々訓練されていたタスクよりも大きなタスクを習得できることを指摘しました。
利用可能性
OpenAI は、GitHub 上で MLSH エージェントのトレーニングコードおよびこれらのアルゴリズムの評価に使用された MuJoCo 環境をリリースしました。
Sources
- OriginalLearning a hierarchy