ginwind/VLA-JEPA
[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
解決的問題
VLA-JEPA 透過整合潛在世界模型,提升視覺-語言-行動(VLA)模型的性能。這使得模型能更佳理解與預測環境動態,進而增強機器人在各類基準測試中執行複雜任務的能力。
工作原理
本專案結合視覺-語言模型(Qwen3-VL-2B)與 V-JEPA2 編碼器,建構出能處理視覺輸入與語言指令並輸出機器人動作的模型。支援在機器人專用資料集(LeRobot v2.1 格式)與人類影片資料集上進行訓練,採用基於思考鏈(Chain-of-Thought, CoT)提示的潛在動作訓練方法。
適用對象
專為從事具身人工智慧(embodied AI)研究的機器人研究人員與開發者設計,特別適合希望提升 VLA 模型在模擬與真實環境中泛化能力與效能的使用者。
主要亮點
- 支援在 Droid、LIBERO、BridgeV2 與 Fractal 等多種資料集上進行訓練。
- 與 LeRobot v2.1 資料格式相容,適用於自訂機器人資料集。
- 包含 LIBERO、LIBERO-Plus 與 SimplerEnv 基準測試的評估腳本。
- 整合 Qwen3-VL 與 V-JEPA2,實現更強大的視覺與潛在世界建模能力。
相關
- 專案
- 專案
- 專案
- 專案
- 專案