ginwind/VLA-JEPA

[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

何を解決するか

VLA-JEPAは、潜在的世界モデルを統合することで、視覚言語行動(VLA)モデルの性能を向上させます。これにより、環境のダイナミクスをよりよく理解・予測でき、さまざまなベンチマークで複雑なタスクを実行する能力が向上します。

仕組み

本プロジェクトでは、視覚言語モデル(Qwen3-VL-2B)とV-JEPA2エンコーダーを組み合わせ、視覚入力と言語指示を処理してロボット動作を出力できるモデルを構築しています。ロボット固有のデータセット(LeRobot v2.1形式)と人間の動画データセットの両方で学習が可能で、Chain-of-Thought(CoT)プロンプティングを用いた潜在行動学習アプローチを採用しています。

対象ユーザー

エムベデッドAIに取り組むロボット研究者および開発者向けです。特に、シミュレート環境および現実世界でのVLAモデルの汎化能力と性能を向上させたい方々に適しています。

主な特徴

  • Droid、LIBERO、BridgeV2、Fractalなど、多様なデータセットでの学習をサポート。
  • カスタムロボットデータセット用にLeRobot v2.1データ形式と互換性あり。
  • LIBERO、LIBERO-Plus、SimplerEnvベンチマーク用の評価スクリプトを含む。
  • Qwen3-VLとV-JEPA2の統合により、視覚的および潜在的世界モデリングの性能が向上。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト