hzxie/DynamicVLA
The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)
何を解決するか
DynamicVLAはロボット工学における動的物体操作の課題に対処し、静的なターゲットだけでなく、移動中または状態変化中の物体とも対話できるようにします。
仕組み
視覚観測と自然言語の指示を処理し、ロボットの動作を出力する視覚-言語-行動(VLA)モデルです。トレーニングおよび評価のための完全なパイプラインを提供しており、3Dシーンと物体を含む専用データセット「DOM(Dynamic Object Manipulation)」を備えています。Isaac Labと統合されており、高精度なシミュレーション環境で合成データの生成とベンチマークが可能で、相対移動(デルタ動作)と連続推論をサポートし、スムーズな制御を実現します。
対象ユーザー
身体的知能に焦点を当てたロボット工学の研究者および開発者。特に視覚-言語-行動モデルや動的物体の操作に取り組んでいる方々。
特徴
- DOMデータセット: 3Dシーンと物体を含む、動的物体操作専用のデータセット。
- Isaac Lab統合: 高精度なシミュレーション環境内で合成データ生成とベンチマークを完全サポート。
- VLAアーキテクチャ: 視覚と言語を統合してロボットの動作を制御。
- 柔軟な行動空間: デルタ動作とさまざまな回転表現(例:オイラー角)をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト