ginwind/VLA-JEPA

[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

解决的问题

VLA-JEPA 通过整合潜在世界模型,提升了视觉-语言-动作(VLA)模型的性能。这使得模型能够更好地理解并预测环境动态,从而增强机器人在各类基准测试中执行复杂任务的能力。

工作原理

该项目结合了视觉-语言模型(Qwen3-VL-2B)与 V-JEPA2 编码器,构建了一个能够处理视觉输入和语言指令并输出机器人动作的模型。它支持在机器人专用数据集(LeRobot v2.1 格式)和人类视频数据集上进行训练,采用基于思维链(Chain-of-Thought, CoT)提示的潜在动作训练方法。

适用人群

专为从事具身人工智能(embodied AI)研究的机器人研究人员和开发者设计,尤其适合希望提升 VLA 模型在仿真和真实世界环境中泛化能力与性能的用户。

主要亮点

  • 支持在 Droid、LIBERO、BridgeV2 和 Fractal 等多种数据集上进行训练。
  • 与 LeRobot v2.1 数据格式兼容,适用于自定义机器人数据集。
  • 包含 LIBERO、LIBERO-Plus 和 SimplerEnv 基准测试的评估脚本。
  • 集成 Qwen3-VL 和 V-JEPA2,实现更强大的视觉与潜在世界建模能力。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目