OpenAIがロボットハンドでルービックキューブを解く

OpenAIは、人間のようなロボットハンドを使用してルービックキューブを解くことができるシステムを開発しました。シミュレーション内でニューラルネットワークを完全にトレーニングし、Automatic Domain Randomization (ADR)と呼ばれる新しい手法を採用することで、このシステムは複雑な器用な操作スキルを物理的なハードウェアに転送することができ、強化学習が高度な自由度をを必要とする現実世界の課題を解決できることを示しています。

Automatic Domain Randomization (ADR)

Automatic Domain Randomization (ADR)は、段階的に難易度の高いシミュレーション環境を自動的に生成することで、ニューラルネットワークをシミュレーションから現実世界へと転送することを可能にします。このアプローチにより、ロボットハンドやルービックキューブのような複雑な物体に対して、達成が困難なことが多い現実世界の完璧に正確な物理モデルを必要とせずに済みます。

ADRの仕組み

ADRは、まず単一の非ランダム化された環境から始まり、そこでニューラルネットワークがキューブを解く方法を学習します。ネットワークが特定のパフォーマンスの閾値に達すると、システムはドメインのランダム化の量を自動的に増加させます。これにより、ネットワークはより幅広い条件に一般化することを強制され、ネットワークの改善に伴ってこのプロセスが繰り返されます。

ランダム化されるパラメータには以下が含まれます:

  • ルービックキューブのサイズ
  • キューブの質量
  • ロボット指の摩擦
  • ハンドの視覚的な表面素材

手動によるランダム化に対する利点

手動によるドメインのランダム化とは異なり(手動の場合は、転送を妨げるほど狭すぎず、かつ学習を不可能にするほど広すぎない範囲を専門家が指定する必要があります)、ADRは人間の介入なしにこれらの範囲を自動的に拡張します。ブロックの反転タスクにおけるADRと手動のランダム化を比較するテストでは、ADRは最終的に人間のチューニングを必要とせずにベースラインの2倍の転送パフォーマンスを実現しました。

堅牢性と創発的なメタ学習

このシステムは、訓練中に遭遇しなかった摂動(例えば、ぬいぐるみのキリンによって突かれること)に対して非常に堅牢です。この堅牢性は、創発的なメタ学習に起因しています。ここで、ネットワークは、展開される環境に迅速に適応するための一般的な学習アルゴリズムを学習します。

適応性のテスト

OpenAIは、シミュレーションにおけるキューブの反転の「成功までの時間」を測定することで、この仮説を検証しました。ネットワークのメモリをリセットしたり、ダイナミクスをリセットしたり、関節を破損させたりといった摂動が加えられた際、成功までの時間は初期に急増しましたが、ネットワークが新しい条件に適応し、再学習することで、ベースラインへと戻りました。

ニューラルネットワークの解釈可能性

OpenAIは、interpretability toolboxからnon-negative matrix factorizationを使用することで、ネットワークのメモリを可視化しました。高次元のベクトルは、6つの色分けされたグループに凝縮されました。分析の結果、各メモリグループは意味のある行動に対応しており、研究者は、実際にアクションが起こる前に、ネットワークがキューブを回転させようとしているのか、あるいは面を時計回りに回転させようとしているのかを特定することができました。

パフォーマンスと課題

システムは、どのような初期条件からでもルービックキューブを解くことができますが、現在は、スクランブルの複雑さに応じた成功率に課題を抱えています:

  • 最大限に難しいスクランブル(26回の面回転): 20%の成功率。
  • より単純なスクランブル(15回の回転): 60%の成功率。

失敗は通常、最初の数回の面回転と反転の際に発生します。これは、ネットワークがキューブを解くことと、現実世界の物理的特性に適応することの同時並行が必要だからです。もしキューブが手から落ちた場合、ネットワークはキューブが再びハンドに置かれた際に、解法を継続する能力を持っています。

開発経路とプロトタイプ

問題を扱いやすくするために、OpenAIは、通常のルービックキューブに移行する前に、一連のカスタムキューブのプロトタイプを段階的に利用しました:

Prototype Position + Orientation Internal degrees of freedom (sensor)
Locked cub Vision 0 No sensor
Face cub PhaseSpace 2 PhaseSpace
Full cube PhaseSpace 6 PhaseSpace
Giiker cube Giiker cube Built-in sensors
Regular Rubik's Cube Vision 6 Vision

通常のルービックキューブにおいて、回転対称性を打破するために、各センターキューブレットのステッカーの一部が切り抜かれています。

Sources