OpenAI ロボティクス研究のための材料

OpenAI は、8 つのシミュレートされたロボティクス環境と Baselines の Hindsight Experience Replay (HER) 実装をリリースしました。これらのツールは、物理ロボットに転送できるモデルのトレーニングを容易にするように設計されており、既存の MuJoCo 連続制御環境よりも困難な操作タスクを特に対象としています。

シミュレートされたロボティクス環境

OpenAI は、MuJoCo 物理シミュレータを使用した Gym 用の 8 つの新しい環境を提供し、これらは 2 つのロボットプラットフォームに分かれています:

Fetch Research Platform

  • FetchReach-v0: ロボットはエンドエフェクターを特定の目標位置に移動させなければなりません。
  • FetchSlide-v0: ロボットはテーブルの上でパックを打ち、それが滑って望む目標の場所に止まるようにしなければなりません。
  • FetchPush-v0: ロボットは箱を望む目標位置に到達するまで押し続けなければなりません。
  • FetchPickAndPlace-v0: ロボットはテーブルから箱を持ち上げ、テーブルの上の目標位置に移動させなければなりません。

ShadowHand Robot

  • HandReach-v0: ロボットは親指と選択された指を使って、手のひらの上の目標位置で合わせなければなりません。
  • HandManipulateBlock-v0: ロボットはブロックを操作して、望む位置と回転を達成しなければなりません。
  • HandManipulateEgg-v0: ロボットは卵を操作して、望む位置と回転を達成しなければなりません。
  • HandManipulatePen-v0: ロボットはペンを操作して、望む位置と回転を達成しなければなりません。

ゴールベース学習とスパース報酬

すべての新しい環境は、目標位置や向きなどの「ゴール」の概念を導入します。デフォルトでは、これらの環境はスパース報酬を使用し、ゴールが達成された場合(許容範囲内)は 0、そうでない場合は -1 の値を返します。密な報酬のバリエーションも利用可能ですが、OpenAI は実際のロボティクスアプリケーションにおいてより現実的であるため、スパース報酬の使用を推奨しています。

ヒンドサイト エクスペリエンス リプレイ (HER)

スパース報酬からの学習の難しさ—エージェントが多くの試行で常に -1 の信号を受け取る場合—に対処するため、OpenAI は Baselines の Hindsight Experience Replay (HER) 実装をリリースしました。

HER は、エピソード中に実際に達成されたゴールに元のゴールを置き換えることで、エージェントが失敗から学習できるようにします。達成された状態を意図したゴールであると仮装することで、エージェントは主要なタスクに失敗しても正の学習信号を受け取ります。時間とともに、これによりエージェントは元の目標を含む任意のゴールを達成する方法を学ぶことができます。

HER はオフポリシー強化学習アルゴリズムであり、Deep Deterministic Policy Gradient (DDPG) などの他のオフポリシー手法と組み合わせることができます。テストでは、スパース報酬での DDPG + HER の組み合わせは、バニラ DDPG および密な報酬での DDPG + HER を大きく上回り、難しいタスクである HandManipulateBlockRotateXYZ-v0 でもそうでした。

HER の今後の研究方向

OpenAI は、HER と一般的な強化学習を改善するためのいくつかの分野を特定しました:

  • Automatic Goal Creation: ハードコードされた方法ではなく、ヒンドサイトゴールを選択する戦略を学習する。
  • Unbiased HER: 重要度サンプリングを利用して、ゴール置換による潜在的な不安定性を防ぐための HER の無偏バージョンを導出する。
  • HER + HRL: 階層的強化学習 (HRL) と HER を組み合わせ、上位レベルのポリシーによって生成された行動にヒンドサイトを適用する。
  • Richer Value Functions: 成功の閾値や割引因子などの追加入力に対して価値関数を条件付けする。
  • Faster Information Propagation: 安定性を犠牲にせずにトレーニングを高速化するためのターゲットネットワークの代替手段を調査する。
  • HER + Multi-step Returns: ゴール置換のオフポリシー性にもかかわらず、マルチステップリターンを使用する方法を見つける。
  • On-policy HER: 重要度サンプリングを介して、PPO などの安定したオンポリシーアルゴリズムと HER の組み合わせを探求する。
  • Sample Efficiency: 行動の頻度が無限大に向かって増加してもパフォーマンスを維持するアルゴリズムを設計する。
  • Integration: Prioritized Experience Replay、ディストリビューショナル RL、またはエントロピー正則化 RL などの進歩と HER を組み合わせる。

ゴールベース環境のための Gym API の変更

これらの環境をサポートするため、Gym API は以下の変更で更新されました:

  • Observation Space: ゴールベースの環境は現在は gym.spaces.Dict 観測空間を使用し、その中に desired_goalachieved_goal、および observation (ロボットの状態) が含まれます。
  • Reward Function Exposure: 環境の報酬関数は現在は公開されており、アルゴリズムが置換されたゴールに基づいて報酬を再計算できるようになります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch