apple-aiml-research/ml-egodex

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

解決的問題

EgoDex 提供一個大規模、高品質的資料集與基準,協助 AI 模型學習複雜的精細手部操作。透過提供配對的自視角影片與精確的 3D 姿態標註,解決了機器人或 AI 在執行複雜桌面任務時缺乏可用資料的問題。

如何運作

使用 Apple Vision Pro 和 ARKit 收集的資料集包含 194 種不同任務的 829 小時 1080p 影片。每個影片皆配有一個包含以下內容的 HDF5 檔案:

  • 3D 姿態標註:頭部、上半身以及 68 個手部關節的 SE(3) 變換。
  • 置信度分數:表示關節偵測可靠性的數值。
  • 語言元資料:由 LLM 和 VLM(GPT-4)生成的任務描述。

該儲存庫包含 Python 程式碼,可將資料載入 PyTorch、視覺化 3D 骨骼資料,並計算距離指標以評估軌跡預測品質。

適用對象

  • 機器人研究人員:開發用於精細操作的機器人基礎模型或視覺-語言-行動(VLA)模型的研究者。
  • 電腦視覺工程師:從自視角影片進行 3D 人體姿態估計的研究人員。
  • AI 開發者:任何訓練模型以模擬人類手部動作用於機器人部署的人。

亮點

  • 超大規模:超過 800 小時的自視角影片,附帶 3D 標註。
  • 任務多樣:涵蓋 194 種不同的主動桌面操作任務。
  • 高精度:使用 ARKit on visionOS 實現對手部與身體的詳細骨骼追蹤。
  • 整合基準測試:包含用於評估預測精細軌跡品質的工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案