malik-group/do-as-i-do

Official Codebase for "Do as I Do: Dexterous Manipulation Data from Everyday Human Videos"

解決的問題

Do as I Do 設計用於幫助機器人從人類與物體互動的影片中學習。它解決了將人類在影片示範中的手-物體互動,轉換為機器人能在實體硬體上實際執行的軌跡這一問題。

工作原理

本專案使用三階段流程:

  1. 重建:將人類手部與物體的影片轉換為3D網格、點雲圖與6自由度(6-DoF)姿態追蹤。此過程涉及一系列工具,如 SAM3、SAM3D、MoGe、HaWoR 與 TAPIR。
  2. 重定向:將重建的人類動作映射至機器人手與手臂上。此過程使用凸分解、MJCF場景產生,以及 MuJoCo Warp 中的取樣式MPC,以確保動作對機器人而言是可行的。
  3. 部署:將重定向後的動作轉換為特定硬體(雙UR3e機械臂與Sharpa Wave手)的關節軌跡,並流式傳送到真實機器人進行重播。

適用對象

適用於從事機器人研究與開發的研究人員與開發者,特別是專注於設備端學習(LfD)與人類至機器人運動重定向的領域。

主要亮點

  • 端對端流程:涵蓋從原始影片輸入到真實世界機器人執行的全部流程。
  • 機器人專用部署:已在雙UR3e機械臂與Sharpa Wave手的硬體上完成測試與部署。
  • 整合多種AI工具:結合視覺導向的重建與物理導向的重定向技術。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案