ShuangLI59/unified_video_action

Official PyTorch Implementation of Unified Video Action Model (RSS 2025)

解决的问题

统一视频动作(UVA)模型解决了训练机器人操作策略的挑战,这些策略既能预测未来的视频帧(视觉预见性),又能执行精确的动作。该模型旨在创建一个统一框架,将视频生成与动作预测结合处理,从而提升机器人在不同任务间的泛化能力。

工作原理

UVA 采用两阶段训练流程来优化性能:

  1. 视频生成阶段:模型首先仅在视频生成任务上进行训练,以学习世界变化的视觉表征。
  2. 视频与动作联合阶段:随后,模型被微调以同时预测未来的视频帧和相应的机器人动作。

它基于预训练的 VAE 和图像生成模型(MAR)作为基础。在真实世界部署中,支持多种硬件配置,包括 ARX X5 机器人,并采用不同的历史频率等技术来处理训练数据与实时控制频率之间的差异。

适用人群

从事模仿学习、基于视频的动作预测以及具身人工智能的机器人研究人员和开发者,希望将视觉预见性集成到机器人控制中。

主要亮点

  • 两阶段训练:通过将视觉学习与动作学习分离,提升稳定性和性能。
  • 多任务支持:已在仿真任务(PushT、Libero10)和真实世界任务(杯子排列、毛巾折叠、鼠标排列)中得到验证。
  • 真实世界部署:包含针对 ARX X5 机器人和 UMI 硬件集成的具体说明。
  • 可扩展架构:为添加新任务和自定义模型提供了清晰路径。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目