ShuangLI59/unified_video_action
Official PyTorch Implementation of Unified Video Action Model (RSS 2025)
解決的問題
統一視頻動作(UVA)模型解決了訓練機器人操作策略的挑戰,這些策略既能預測未來的影片幀(視覺預見性),又能執行精確的動作。該模型旨在建立一個統一框架,將視頻生成與動作預測結合處理,從而提升機器人在不同任務間的泛化能力。
工作原理
UVA 採用兩階段訓練流程來優化性能:
- 視頻生成階段:模型首先僅在視頻生成任務上進行訓練,以學習世界變化的視覺表徵。
- 視頻與動作聯合階段:隨後,模型被微調以同時預測未來的視頻幀和相應的機器人動作。
它基於預訓練的 VAE 和影像生成模型(MAR)作為基礎。在真實世界部署中,支援多種硬體配置,包括 ARX X5 機器人,並採用不同的歷史頻率等技術來處理訓練資料與即時控制頻率之間的差異。
適用對象
從事模仿學習、基於視頻的動作預測以及具身人工智慧的機器人研究人員與開發者,希望將視覺預見性整合到機器人控制中。
主要亮點
- 兩階段訓練:透過將視覺學習與動作學習分離,提升穩定性與性能。
- 多任務支援:已在模擬任務(PushT、Libero10)和真實世界任務(杯子排列、毛巾摺疊、滑鼠排列)中得到驗證。
- 真實世界部署:包含針對 ARX X5 機器人和 UMI 硬體整合的具體說明。
- 可擴展架構:為新增任務和自訂模型提供了清晰路徑。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案