apple-aiml-research/ml-egodex

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

解决的问题

EgoDex 提供了一个大规模、高质量的数据集和基准,帮助 AI 模型学习复杂的精细手部操作。通过提供配对的自视角视频和精确的 3D 姿态标注,它解决了机器人或 AI 在执行复杂桌面任务时缺乏可用数据的问题。

如何工作

使用 Apple Vision Pro 和 ARKit 收集的数据集包含 194 种不同任务的 829 小时 1080p 视频。每个视频都配有一个包含以下内容的 HDF5 文件:

  • 3D 姿态标注:头部、上半身以及 68 个手部关节的 SE(3) 变换。
  • 置信度分数:表示关节检测可靠性的数值。
  • 语言元数据:由 LLM 和 VLM(GPT-4)生成的任务描述。

该仓库包含 Python 脚本,用于将数据加载到 PyTorch 中,可视化 3D 骨骼数据,并计算距离度量以评估轨迹预测质量。

适用对象

  • 机器人研究人员:开发用于精细操作的机器人基础模型或视觉-语言-动作(VLA)模型的研究者。
  • 计算机视觉工程师:从事从自视角视频中进行 3D 人体姿态估计的研究人员。
  • AI 开发者:任何训练模型以模仿人类手部动作用于机器人部署的人。

亮点

  • 超大规模:超过 800 小时的自视角视频,附带 3D 标注。
  • 任务多样:涵盖 194 种不同的主动桌面操作任务。
  • 高精度:使用 ARKit on visionOS 实现对手部和身体的详细骨骼追踪。
  • 集成基准测试:包含用于评估预测精细轨迹质量的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目