InternRobotics/VLAC

VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning

解决的问题

VLAC 旨在改善真实世界机器人强化学习与数据精炼。它解决了在机器人操作任务中提供密集且准确的奖励反馈,以及过滤低质量轨迹的挑战,这在传统方法中通常难以实现。

工作原理

VLAC 是一种视觉-语言-动作-评论家模型,通过海量的人类第一人称视角数据、公开机器人操作数据与自行收集的数据进行训练。它使用成对比较机制来评估任务进度并识别帧之间的状态变化。通过结合图像输入与任务描述,该模型能够预测任务进度、验证任务完成情况,并区分成功与失败的动作。

适用对象

本项目适用于从事具身智能研究的机器人研究人员与开发者,特别是那些专注于强化学习、模仿学习,以及需要高质量轨迹数据来训练机器人的人员。

亮点

  • 成对比较:提升密集评论家奖励与状态变化识别的准确度。
  • 多模态能力:支持过程跟踪、任务完成判断、VQA 与具身动作输出。
  • 零样本/单样本泛化:在未经额外训练的情况下,仍能在新实体、场景与任务中保持性能。
  • 轨迹质量筛选:过滤低分轨迹并屏蔽负面动作,以提升模仿学习效率。
  • 人类-任务共感觉:利用人类第一人称视角数据 (Ego4D) 来更好地理解真实世界的人类任务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目