OpenAI プラン・オンライン・ラーニング・オフライン(POLO)フレームワーク

OpenAI は、内部モデルを持つエージェントが環境内で継続的に行動し学習するための手法である Plan Online Learn Offline(POLO)フレームワークを導入しました。このフレームワークは、ローカルな軌道最適化とグローバルな価値関数学習の相乗的関係を構築することで、複雑な制御タスクにおける学習効率と探索の安定性を向上させるよう設計されています。

相乗的なモデルベース制御と価値学習

POLO フレームワークは、ローカルなモデルベース制御とグローバルな価値関数学習が相互に強化し合い、各々の制約を克服できるという原理に基づいて動作します。

ローカル軌道最適化

ローカル軌道最適化は、エージェントがグローバル価値関数の近似誤差に対処できるようにします。ローカルに計画することで、エージェントは価値関数の学習プロセスを安定させ、加速させることができます。

グローバル価値関数学習

近似価値関数は、エージェントが計画ホライズンを縮小できるようにするグローバルな視点を提供します。このホライズンの縮小により、エージェントは単純なローカル解を超えるポリシーを発見・実装できるようになります。

時間的に協調された探索

複雑な環境での効率的な学習には、エージェントが状態空間を効果的に探索する必要があります。POLO は軌道最適化を利用して、時間的に協調された探索を実行します。

この探索戦略は、軌道最適化と価値関数近似における不確実性の推定を組み合わせることで実装されます。この協調的アプローチは、価値関数の高速かつ安定した学習にとって重要です。

複雑な制御タスクにおける性能

POLO フレームワークは、サンプル効率が高い複雑なシミュレート制御タスクの解決を可能にします。具体的には、以下のタスクにフレームワークが適用されました:

  • Humanoid Locomotion: シミュレートされたヒューマノイドが歩行できるようにする。
  • Dexterous In-Hand Manipulation: シミュレートされた手での複雑な物体操作を管理する。

OpenAI によると、これらのタスクは実世界で数分間の経験に相当する時間で解決されたとのことです。

Sources