TX-Leo/HumanEgo

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos

何を解決するか

HumanEgo は、人間のエゴセントリック動画の非常に短い時間(数分)から複雑なタスクを学習できるようにします。第一人称視点で撮影された人間のデモンストレーションをロボットの実行に移行する課題に対処し、ロボット固有の大量の訓練データを必要としません。

動作方法

このシステムは、Project Aria グラスなどの原始的な第一人称動画をロボット実行可能なポリシーに変換するパイプラインを使用しています。視覚基盤モデル(SAM 2、Grounding DINO、CoTracker、Orient-Anything V2)を用いてデータを前処理します。訓練プロセスでは、「インタラクション中心トークン」(手と物体の6DoF表現)と、ロボットアームが補完された(インペイントされた)身体に依存しない画像を入力とするフローマッチングポリシーを使用し、二腕ロボットの将来のエンドエフェクタ軌道を予測します。

対象ユーザー

手動のロボットプログラミングや大規模なロボットデータセットではなく、人間のデモンストレーションを使ってロボットを訓練したいロボティクス研究者や開発者。

特徴

  • ゼロショット学習: 数分間の人間エゴセントリック動画から学習可能。
  • 身体に依存しない: インペイントされた画像とインタラクショントークンを使用し、人間のデモンストレーションを特定のロボットハードウェアから分離。
  • 包括的なツールキット: Project Aria によるデータ収集、前処理、訓練、実ロボット推論までをカバーする完全なパイプライン。
  • オープンデータセット: パンを提供する、花に水をやるなどのタスク用にリリースされたデータセットと事前学習済みチェックポイントを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch