ginwind/VLA-JEPA
[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
解决的问题
VLA-JEPA 通过整合潜在世界模型,提升了视觉-语言-动作(VLA)模型的性能。这使得模型能够更好地理解并预测环境动态,从而增强机器人在各类基准测试中执行复杂任务的能力。
工作原理
该项目结合了视觉-语言模型(Qwen3-VL-2B)与 V-JEPA2 编码器,构建了一个能够处理视觉输入和语言指令并输出机器人动作的模型。它支持在机器人专用数据集(LeRobot v2.1 格式)和人类视频数据集上进行训练,采用基于思维链(Chain-of-Thought, CoT)提示的潜在动作训练方法。
适用人群
专为从事具身人工智能(embodied AI)研究的机器人研究人员和开发者设计,尤其适合希望提升 VLA 模型在仿真和真实世界环境中泛化能力与性能的用户。
主要亮点
- 支持在 Droid、LIBERO、BridgeV2 和 Fractal 等多种数据集上进行训练。
- 与 LeRobot v2.1 数据格式兼容,适用于自定义机器人数据集。
- 包含 LIBERO、LIBERO-Plus 和 SimplerEnv 基准测试的评估脚本。
- 集成 Qwen3-VL 和 V-JEPA2,实现更强大的视觉与潜在世界建模能力。
相关
- 项目
- 项目
- 项目
- 项目
- 项目