H-EmbodVis/TurboVLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA – 実時間ビジョン・言語・アクションモデル

何であるか – TurboVLA は、生のカメラ画像と自然言語指示を直接ロボットの関節動作にマッピングする研究用ニューラルポリシーです。従来の「ビジョン → 大規模言語モデル → アクション」パイプラインを、軽量な V + L → A アーキテクチャに置き換え、RTX 4090 で 32 Hz の推論を実現しながら、1 GB未満のVRAM を使用します。

主なアイデア

  • ビジョン(DINOv3 ViT‑B/L)と言語(BERT‑base)のための分離エンコーダ。
  • GroundingDINO を基盤とする双方向のビジョン・言語相互作用モジュールにより、大規模なLLMを使わずに両モダリティ間で情報交換を可能にします。
  • 連続的なアクションチャンク(LIBERO では 12 ステップ、RoboTwin では 50 ステップ)を予測するコンパクトなデコーダにより、レイテンシをさらに削減します。

パフォーマンス

  • LIBERO ベンチマーク:平均成功率 97.7 %、パラメータ数 0.2 B、レイテンシ 31 ms、VRAM 0.9 GB。
  • より大きなVLAベースラインと同等またはそれを上回りながら、実行コストははるかに低いです。

導入方法

  1. クローンとセットアップ – リポジトリには以下の2つのオプション環境が用意されています:
    • turbovla-libero:LIBERO シミュレーションスイート用。
    • turbovla-robotwin:RoboTwin 2.0 ロボットシミュレータ用。
  2. 依存関係のインストール – CUDA互換のPyTorchビルドをインストール後、pip install -e "[libero]" または "[robotwin]" エクストラを使用します。
  3. モデルとデータのダウンロード – モデルチェックポイントと正規化統計情報は Hugging Face にホストされています。データセット(LIBERO TFDS/RLDSスイートまたは RoboTwin Clean)はヘルパースクリプトで取得できます。
  4. 学習torchrun コマンドの例が、論文で使用された正確なハイパーパラメータ(バッチサイズ、最適化ステップ、ウォームアップなど)を示しています。
  5. 評価 – シングルコマンドスクリプトで、任意のLIBEROスイートまたはすべての50タスクのRoboTwinでチェックポイントを評価できます。

対応ハードウェア – 主にエントリーレベルの RTX 4090 GPU でテスト済み。TODOエントリには、将来の Huawei Ascend NPU 対応が記載されています。

ライセンス – Apache 2.0。

引用 – README には、arXiv ペーパー(arXiv:2607.27205)用のコピー可能な BibTeX エントリが提供されています。


結論 – TurboVLA は、ロボット操作向けの高速・低メモリなビジョン・言語・アクションモデルの実装であり、学習/評価スクリプト、環境セットアップ手順、事前学習済みチェックポイントをすべて備えたオープンソースプロジェクトです。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch