malik-group/do-as-i-do

Official Codebase for "Do as I Do: Dexterous Manipulation Data from Everyday Human Videos"

解决的问题

Do as I Do 旨在帮助机器人从人类与物体交互的视频中学习。它解决了将人类在视频演示中的手-物体交互转换为机器人能够在物理硬件上实际执行的轨迹这一难题。

工作原理

该项目采用三阶段流水线:

  1. 重建:将人类手部与物体的视频转换为3D网格、点云图和6自由度(6-DoF)姿态追踪。该过程涉及一系列工具,如 SAM3、SAM3D、MoGe、HaWoR 和 TAPIR。
  2. 重定向:将重建的人类运动映射到机器人手和臂上。该过程使用凸分解、MJCF场景生成以及 MuJoCo Warp 中的基于采样的MPC,以确保运动对机器人是可行的。
  3. 部署:将重定向后的运动转换为特定硬件(双UR3e机械臂和Sharpa Wave手)的关节轨迹,并流式传输到真实机器人进行回放。

适用人群

适用于从事机器人研究与开发的研究人员和开发者,特别是专注于设备端学习(LfD)和从人类到机器人的运动重定向的领域。

主要亮点

  • 端到端流水线:涵盖从原始视频输入到真实世界机器人执行的全部流程。
  • 机器人专用部署:已在双UR3e机械臂与Sharpa Wave手的硬件上完成测试与部署。
  • 多种AI工具集成:整合了基于视觉的重建与基于物理的重定向技术。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目