malik-group/do-as-i-do
Official Codebase for "Do as I Do: Dexterous Manipulation Data from Everyday Human Videos"
解決的問題
Do as I Do 設計用於幫助機器人從人類與物體互動的影片中學習。它解決了將人類在影片示範中的手-物體互動,轉換為機器人能在實體硬體上實際執行的軌跡這一問題。
工作原理
本專案使用三階段流程:
- 重建:將人類手部與物體的影片轉換為3D網格、點雲圖與6自由度(6-DoF)姿態追蹤。此過程涉及一系列工具,如 SAM3、SAM3D、MoGe、HaWoR 與 TAPIR。
- 重定向:將重建的人類動作映射至機器人手與手臂上。此過程使用凸分解、MJCF場景產生,以及 MuJoCo Warp 中的取樣式MPC,以確保動作對機器人而言是可行的。
- 部署:將重定向後的動作轉換為特定硬體(雙UR3e機械臂與Sharpa Wave手)的關節軌跡,並流式傳送到真實機器人進行重播。
適用對象
適用於從事機器人研究與開發的研究人員與開發者,特別是專注於設備端學習(LfD)與人類至機器人運動重定向的領域。
主要亮點
- 端對端流程:涵蓋從原始影片輸入到真實世界機器人執行的全部流程。
- 機器人專用部署:已在雙UR3e機械臂與Sharpa Wave手的硬體上完成測試與部署。
- 整合多種AI工具:結合視覺導向的重建與物理導向的重定向技術。
相關
- 專案
- 專案
- 專案
- 專案
- 專案