OpenAI マルチゴール強化学習ロボティクス環境

OpenAI は、マルチゴール強化学習 (RL) の分野を進歩させるために設計された挑戦的な連続制御タスクのスイートを導入しました。これらの環境は OpenAI Gym と統合されており、追加の入力指示に基づいてさまざまな目標を達成するために学習しなければならないエージェントをテストするための標準化されたフレームワークを提供します。

ロボティクス環境とハードウェア

新しい環境スイートは、既存のロボットハードウェアに基づく連続制御タスクに焦点を当てています。タスクは、シミュレートするハードウェアによって分類されます:

  • Fetch ロボティックアーム: プッシュ、スライド、ピックアンドプレース操作を含みます。
  • Shadow デクスタラスハンド: 手内オブジェクト操作に焦点を当てたタスクです。

マルチゴール RL フレームワーク

これらの環境はマルチゴール強化学習フレームワークを利用しています。この設定では、エージェントは達成することを意図したゴールを指定する追加の入力が提供されます。これは、特定のタスクを学習するシングルゴール RL と異なります。

厳格なテスト環境を維持するため、このスイート内のすべてのタスクはスパースバイナリーリワードを特徴とし、これはゴールが正常に達成されたときのみエージェントにリワードが与えられ、密なリワード関数によってガイドされるわけではないことを意味します。

研究目的とヒンドサイト経験再生

環境のリリースに加えて、OpenAI の技術報告書は RL アルゴリズムを改善するための具体的な研究方向を提案しています。この研究要請の主な焦点は、マルチゴール RL とヒンドサイト経験再生 (HER) の改善です。

HER は、到達した状態を仮想ゴールとして扱うことで失敗から学ぶことを助ける技術であり、これによりエージェントは元の意図したゴールを達成しなかった軌跡を含むすべての軌跡から学習信号を抽出することができます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch