ShuangLI59/unified_video_action

Official PyTorch Implementation of Unified Video Action Model (RSS 2025)

何を解決するか

Unified Video Action (UVA) モデルは、将来の動画フレームを予測する(視覚的予見性と呼ばれる)ことと、正確な動作を実行することの両方を可能にするロボット操作ポリシーの訓練という課題に対処します。視覚的予見性と動作予測を統合した統一されたフレームワークを構築することを目指しており、ロボットが異なるタスク間で一般化する能力を向上させます。

動作方法

UVAは、パフォーマンスを最適化するための二段階トレーニングプロセスを使用しています:

  1. 動画生成段階:モデルは最初に動画生成タスクに特化して訓練され、世界の変化の視覚的表現を学習します。
  2. 動画と動作の同時段階:その後、モデルは将来の動画フレームとそれに応じたロボット動作の両方を同時に予測するようにファインチューニングされます。

事前学習された VAE と画像生成モデル(MAR)を基盤としています。実世界への展開では、ARX X5 ロボットなどのさまざまなハードウェア構成をサポートし、トレーニングデータとリアルタイム制御周波数の違いに対処するための手法(異なる履歴周波数)を組み込んでいます。

対象ユーザー

模倣学習、動画ベースの動作予測、エムブデッドAIに取り組んでいるロボット研究者および開発者で、ロボット制御に視覚的予見性を統合したい方。

主な特徴

  • 二段階トレーニング:視覚学習と動作学習を分離することで、安定性とパフォーマンスを向上。
  • マルチタスク対応:シミュレーションタスク(PushT、Libero10)および実世界タスク(カップ配置、タオル折り、マウス配置)で実証済み。
  • 実世界展開:ARX X5 ロボットおよび UMI ハードウェア統合のための具体的な手順を含む。
  • 拡張可能なアーキテクチャ:新しいタスクやカスタムモデルの追加に明確な道筋を提供。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト