PKU-EPIC/GraspVLA

[CoRL25] GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

解决的问题

GraspVLA 解决了训练机器人抓取模型所面临的高成本和数据稀缺问题。它使机器人能够在无需昂贵的真实世界微调的情况下,对现实世界中的多样化物体执行开放词汇抓取,实现直接的仿真到现实的迁移。

工作原理

该项目包含三个主要组件:

  1. SynGrasp-1B:一个庞大的合成数据集,包含 240 个物体类别和超过 10,000 个物体的 10 亿帧抓取数据。
  2. GraspVLA 模型:一个在合成数据上预训练的视觉-语言-动作(VLA)模型。它使用统一的思维链(CoT)框架,将自回归感知(预测边界框和目标)与基于流匹配的动作生成相结合。
  3. 混合训练:模型在合成动作数据和互联网规模的语义数据上进行训练,使其能够理解并执行开放词汇命令。

适用人群

从事机器人操作、仿真到现实迁移以及具身智能基础模型的机器人研究人员和开发者。

主要亮点

  • 零样本泛化:在合成预训练后,无需额外微调即可抓取现实世界物体。
  • 十亿级数据:利用 SynGrasp-1B 数据集,提供大量多样化的训练样本。
  • 高效推理:在 NVIDIA RTX L40s 上使用约 9GB GPU 内存,实现 200ms 推理延迟。
  • 集成推理:通过 CoT 框架将感知与动作整合为单一推理过程。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目