apple-aiml-research/ml-egodex

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

何を解決するか

EgoDexは、複雑な機敏な手の操作を学習するための、大規模かつ高品質なデータセットとベンチマークを提供します。エゴセントリック動画と正確な3Dポーズのアノテーションをペアで提供することで、ロボットやAIがテーブル上の複雑なタスクを実行するためのデータ不足の問題に対処します。

仕組み

Apple Vision ProとARKitを使用して収集されたデータセットは、194の異なるタスクで合計829時間の1080p動画を含んでいます。各動画は、以下の内容を含むHDF5ファイルとペアになっています:

  • 3Dポーズアノテーション:頭部、上半身、および68個の手関節のSE(3)変換。
  • 信頼度スコア:関節検出の信頼性を示す値。
  • 言語メタデータ:GPT-4などのLLMおよびVLMによって生成されたタスクの説明。

リポジトリには、データをPyTorchに読み込むためのPythonスクリプト、3D骨格データの可視化、および軌道予測の品質を評価するための距離メトリクスの計算ツールが含まれています。

対象ユーザー

  • ロボット工学研究者:機敏な操作向けのロボット基礎モデルや、視覚言語行動(VLA)モデルを開発している人。
  • コンピュータビジョンエンジニア:エゴセントリック動画から3D人体ポーズを推定する研究に従事している人。
  • AI開発者:ロボット展開用に人間の手の動きを模倣するモデルを訓練している人。

特徴

  • 大規模なスケール:3Dアノテーション付きの800時間以上のエゴセントリック動画。
  • 多様なタスク:194の異なるアクティブなテーブル上操作タスクをカバー。
  • 高精度:visionOS上のARKitを使用して、手と体の詳細な骨格追跡を実現。
  • 統合されたベンチマーク:予測された機敏な軌道の品質を評価するためのツールを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト