hzxie/DynamicVLA

The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)

何を解決するか

DynamicVLAはロボット工学における動的物体操作の課題に対処し、静的なターゲットだけでなく、移動中または状態変化中の物体とも対話できるようにします。

仕組み

視覚観測と自然言語の指示を処理し、ロボットの動作を出力する視覚-言語-行動(VLA)モデルです。トレーニングおよび評価のための完全なパイプラインを提供しており、3Dシーンと物体を含む専用データセット「DOM(Dynamic Object Manipulation)」を備えています。Isaac Labと統合されており、高精度なシミュレーション環境で合成データの生成とベンチマークが可能で、相対移動(デルタ動作)と連続推論をサポートし、スムーズな制御を実現します。

対象ユーザー

身体的知能に焦点を当てたロボット工学の研究者および開発者。特に視覚-言語-行動モデルや動的物体の操作に取り組んでいる方々。

特徴

  • DOMデータセット: 3Dシーンと物体を含む、動的物体操作専用のデータセット。
  • Isaac Lab統合: 高精度なシミュレーション環境内で合成データ生成とベンチマークを完全サポート。
  • VLAアーキテクチャ: 視覚と言語を統合してロボットの動作を制御。
  • 柔軟な行動空間: デルタ動作とさまざまな回転表現(例:オイラー角)をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト