InternRobotics/InternVLA-A-series
InternVLA-A1: Unifying Understanding, Generation, and Action for Robotic Manipulation
解决的问题
InternVLA-A1.5 通过将三个关键能力——视觉-语言理解、视觉预测(预测未来动力学)和动作生成——统一到单个策略中,解决了机器人操作中的组合泛化挑战。
工作原理
该系统使用 Qwen3.5-2B VLM 作为骨干网络,通过共享的全注意力层添加轻量级统一动作专家。在训练期间,它使用可学习的预测 token 从多模态上下文中查询未来动力学,并由冻结的 WAN2.2-5B 视频生成模型进行监督。在实际部署时,为了保持低延迟,会舍弃视频分支,模型使用 flow matching 来预测连续的动作块。
适用对象
专为从事机器人操作研究的机器人研究人员和开发人员设计,特别是那些希望提高机器人在不同仿真基准测试(如 RoboTwin、LIBERO 和 SimplerEnv)和真实世界设置中任务泛化能力的人员。
亮点
- 统一架构:将理解、预测和动作结合在一个模型中。
- 潜在预测:在训练期间使用视频生成模型来教导策略未来的任务动力学。
- 高效推理:在运行时舍弃沉重的视频分支,以确保实际部署的延迟。
- 广泛的兼容性:支持在 LeRobot V2.1 数据集和各种仿真环境中进行微调。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目