OpenAI シミュレーションからの一般化

OpenAIは、シミュレーションで完全に訓練されたロボットコントローラーが物理ロボットに配備され、予期しない環境変化に反応できるようにするロボティクス技術を開発しました。この変化により、シミュレーターが物理世界と完全に一致することを要求せずに、現実世界のダイナミクスに適応できるクローズドループシステムを作成することが可能になります。

環境適応のためのダイナミクスランダマイズ

ダイナミクスランダマイズは、幅広いシミュレートされた条件で訓練することにより、ロボットが未知の現実世界のダイナミクスに適応できるようにします。現実の完璧なレプリカを作ろうとする代わりに、OpenAIはトレーニング中に95種類の異なるプロパティをランダム化します。これには以下が含まれます:

  • ロボットの本体の各リンクの質量。
  • 対象オブジェクトの摩擦と減衰。
  • オブジェクトを支えるテーブルの高さ。
  • アクション間のレイテンシ。
  • 観測ノイズ。

これを実装するために、OpenAIはLSTMベースのポリシーを使用して、ホッケーのパックを押すロボットを訓練しました。標準のフィードフォワードネットワークはこのタスクで失敗しましたが、LSTMは過去の観測を利用して世界のダイナミクスを分析し、リアルタイムで行動を調整できるため成功しました。

エンドツーエンド ビジョン・トゥ・アクション ラーニング

OpenAIは、強化学習(RL)を使用してシミュレーションでエンドツーエンドにロボットを訓練し、ビジョンを直接アクションにマッピングしました。このシステムは特別なセンサーを必要とせず、視覚フィードバックに基づいて適応します。

ヒンドサイト エクスペリエンス リプレイ(HER)によるスパース報酬の克服

従来のRLアルゴリズムは、ピックアンドプレースタスクでしばしば苦労します。これは、機能するために密な報酬(詳細なステップバイステップスコアリング)が必要だからです。これを解決するために、OpenAIはヒンドサイト エクスペリエンス リプレイ(HER)を開発しました。HERは、エージェントがバイナリ報酬から学習できるようにします。HERにより、エージェントは失敗を意図しない状態に到達する成功した試みとして扱うことができ、これにより主要な目標が達成されていたかどうかに関わらず、すべての相互作用から学習することができます。

非対称アクター・クリティック アーキテクチャ

HERの実装は、シミュレーションと現実のギャップを埋めるために、非対称な情報を持つアクター・クリティック手法を使用します:

  • The Critic: シミュレーターの完全な状態にアクセスして、完全に正確なフィードバックを提供し、Q値(将来の報酬の合計)を推定します。
  • The Actor: RGBと深度データのみにアクセスでき、これによりポリシーは物理世界で利用可能なデータのみに依存することを保証します。

視覚システムが現実世界で十分に堅牢であることを確認するために、OpenAIは視覚的な形状にもドメインランダマイズを適用しました。

計算コストと戦略的展望

これらのランダマイズ技術を実装すると、トレーニングの計算オーバーヘッドが増加します。ダイナミクスランダマイズはトレーニングを3倍遅くし、状態ではなく画像から学習するのは5〜10倍遅くなります。

OpenAIは、汎用ロボットを構築するための3つの主要な道筋を特定しています:

  1. 物理ロボットの巨大なフリートでのトレーニング。
  2. シミュレーターの忠実度を高めて現実世界に合わせる。
  3. モデルが現実世界に一般化できるようにシミュレーターをランダム化する。

OpenAIは、第三のアプローチ―一般化のためのランダマイズ―が解決策の最も重要なコンポーネントになるとますます信じていると述べています。

Sources

関連