TX-Leo/HumanEgo
HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos
解決的問題
HumanEgo 讓機器人能從極短時間(數分鐘)的人類第一人稱影片中學習複雜任務。它解決了如何將第一人稱視角拍攝的人類示範轉換為機器人執行的問題,而無需大量機器人專用的訓練資料。
工作原理
該系統使用一個將原始第一人稱影片(例如來自 Project Aria 眼鏡的影片)轉換為機器人可執行策略的流程。它採用視覺基礎模型——包括 SAM 2、Grounding DINO、CoTracker 和 Orient-Anything V2——進行資料預處理。訓練過程使用一種流匹配策略,輸入「以互動為中心的標記」(手與物體的 6DoF 表示)和與具身無關的影像(機器人手臂被修補去除),以預測雙臂機器人的未來末端執行器軌跡。
適用對象
希望使用人類示範而非手動機器人程式設計或大規模機器人資料集來訓練機器人的機器人研究人員與開發者。
主要亮點
- 零樣本學習:僅需數分鐘的人類第一人稱影片即可學習。
- 具身無關性:使用修補後的影像和互動標記,將人類示範與特定機器人硬體解耦。
- 完整工具鏈:包含從 Project Aria 資料收集、預處理、訓練到真實機器人推論的完整流程。
- 開放資料集:提供用於端菜和澆花等任務的已發布資料集與預訓練檢查點。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch