malik-group/do-as-i-do
Official Codebase for "Do as I Do: Dexterous Manipulation Data from Everyday Human Videos"
何を解決するか
Do as I Do は、人間の物体とのインタラクション動画からロボットが学習できるように設計されています。このプロジェクトは、動画デモにおける人間の手と物体のインタラクションを、実際に物理的なハードウェア上で実行可能な軌道に変換するという課題を解決します。
仕組み
このプロジェクトは3段階のパイプラインを使用しています:
- 再構成:人間の手と物体の動画を3Dメッシュ、ポイントマップ、6自由度(6-DoF)のポーズ追跡に変換します。SAM3、SAM3D、MoGe、HaWoR、TAPIRといったツールの連鎖を用います。
- リターゲティング:再構成された人間の動きをロボットの手と腕にマッピングします。凸分解、MJCFシーン生成、MuJoCo WarpにおけるサンプリングベースのMPCを用いて、ロボットにとって実行可能であることを保証します。
- デプロイ:リターゲティングされた動きを特定のハードウェア(デュアル-UR3eアームとSharpa Waveハンド)向けの関節軌道に変換し、リアルロボットにストリーミングして再現します。
対象ユーザー
ロボット工学に取り組む研究者や開発者、特にデバイス内での学習(LfD)および人間からロボットへの運動リターゲティングに注力している方々を対象としています。
主な特徴
- エンドツーエンドのパイプライン:原始的な動画入力から現実世界のロボット実行までをカバー。
- ロボット固有のデプロイ:デュアル-UR3eアームとSharpa Waveハンドで実際にテスト・デプロイ済み。
- 複数のAIツールの統合:視覚ベースの再構成と物理ベースのリターゲティングを統合。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト