2toinf/X-VLA

[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

何を解決するか

X-VLAは、異なるロボットプラットフォーム(エムボディメント)で動作可能な汎用的なビジョン・言語・アクション(VLA)モデルを訓練する課題に対処します。多様なロボットデータセットを活用することで、さまざまなハードウェア間で優れた汎化性能を持つモデルを構築し、ロボット操作タスクにおける機敏さと適応性を向上させます。

動作方法

X-VLAはソフトプロンプト付きのTransformerアーキテクチャを使用しています。エムボディメント固有の学習可能な埋め込み(ソフトプロンプト)を導入し、統一されたTransformerバックボーンが複数のドメインにわたるポリシーを学習できるようにします。一貫性を維持するために、本体感覚入力とアクション出力の両方で統一されたエンドエフェクタ6D(EE6D)制御空間を採用しています。

対象ユーザー

このプロジェクトは、物理ロボットやLeRobotなどのシミュレーションプラットフォームにスケーラブルでクロスプラットフォームのVLAモデルを展開したいロボット研究者および開発者向けです。

主な特徴

  • エムボディメント間の汎化性能: 6つのシミュレーションプラットフォームおよび3台の実機ロボットで最先端のパフォーマンスを達成。
  • サーバー・クライアントアーキテクチャ: モデル環境とロボット固有の依存関係を分離することで、パッケージの競合を回避し、分散推論をサポート。
  • 統一制御空間: 標準化されたEE6D制御空間を使用して、異なるロボットアーム間での一貫性を確保。
  • 拡張可能な学習: LoRA微調整とモジュール式データセットインターフェースをサポートし、カスタムロボットのデモンストレーションを追加可能。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト