TX-Leo/HumanEgo

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos

解决的问题

HumanEgo 使机器人能够从极短时间(几分钟)的人类第一人称视频中学习复杂任务。它解决了如何将第一人称视角拍摄的人类示范转换为机器人执行的问题,而无需大量机器人专用的训练数据。

工作原理

该系统使用一个将原始第一人称视频(例如来自 Project Aria 眼镜的视频)转换为机器人可执行策略的流水线。它采用视觉基础模型——包括 SAM 2、Grounding DINO、CoTracker 和 Orient-Anything V2——进行数据预处理。训练过程使用一种流匹配策略,输入“以交互为中心的标记”(手和物体的 6DoF 表示)和与具身无关的图像(机器人手臂被修补去除),以预测双臂机器人的未来末端执行器轨迹。

适用人群

希望使用人类示范而非手动机器人编程或大规模机器人数据集来训练机器人的机器人研究人员和开发者。

主要亮点

  • 零样本学习:仅需几分钟的人类第一人称视频即可学习。
  • 具身无关性:使用修补后的图像和交互标记,将人类示范与特定机器人硬件解耦。
  • 完整工具链:包含从 Project Aria 数据采集、预处理、训练到真实机器人推理的完整流水线。
  • 开放数据集:提供用于端菜和浇花等任务的已发布数据集和预训练检查点。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch