ginwind/VLA-JEPA

[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

解決的問題

VLA-JEPA 透過整合潛在世界模型,提升視覺-語言-行動(VLA)模型的性能。這使得模型能更佳理解與預測環境動態,進而增強機器人在各類基準測試中執行複雜任務的能力。

工作原理

本專案結合視覺-語言模型(Qwen3-VL-2B)與 V-JEPA2 編碼器,建構出能處理視覺輸入與語言指令並輸出機器人動作的模型。支援在機器人專用資料集(LeRobot v2.1 格式)與人類影片資料集上進行訓練,採用基於思考鏈(Chain-of-Thought, CoT)提示的潛在動作訓練方法。

適用對象

專為從事具身人工智慧(embodied AI)研究的機器人研究人員與開發者設計,特別適合希望提升 VLA 模型在模擬與真實環境中泛化能力與效能的使用者。

主要亮點

  • 支援在 Droid、LIBERO、BridgeV2 與 Fractal 等多種資料集上進行訓練。
  • 與 LeRobot v2.1 資料格式相容,適用於自訂機器人資料集。
  • 包含 LIBERO、LIBERO-Plus 與 SimplerEnv 基準測試的評估腳本。
  • 整合 Qwen3-VL 與 V-JEPA2,實現更強大的視覺與潛在世界建模能力。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案