remyxai/VQASynth

Compose multimodal datasets 🎹

解决的问题

VQASynth 旨在解决 AI 预训练数据集中高质量空间推理数据稀缺的问题。它允许用户将标准图像数据集转换为专注于 3D 空间关系、距离和方向的视觉问答(VQA)数据集,这些对于具身 AI 和机器人技术至关重要。

工作原理

该项目实现了一个融合语义与度量数据的合成空间 VQA 对生成管道。该过程包括:

  1. 定位:使用 Florence-2 和 SAM2 等工具检测并分割与任务相关的对象。
  2. 3D 重建:使用 VGGT 将图像提升至 3D,生成每个对象的点云、深度图和内参。
  3. VQA 生成:使用提示生成器基于重建的 3D 场景生成问题-答案对,通常结合链式思维(CoT)推理以提高准确性。

此外,项目还提供了一种基于代理的方法(通过 NOOA),能够动态组合工具调用(例如,度量深度、对象方向、区域描述),无需遵循预设模板即可实时回答空间问题。

适用人群

  • AI 研究人员:从事视觉-语言模型(VLM)和空间推理的研究者。
  • 机器人开发者:需要理解物理环境中 3D 距离和对象方向的具身 AI 开发工程师。
  • 数据集策展人:希望为现有图像数据集添加基于现实的空间标注的用户。

主要亮点

  • 度量深度集成:用 VGGT 替代 DepthPro,实现更快、更准确的度量深度估计。
  • 合成数据生成:能够生成 SpaceOm 和 SpaceThinker 等数据集,用于 VLM 的指令微调。
  • 动态工具组合:代理版本支持通过多种工具(例如,Orient-Anything、MediaPipe 姿态关键点)灵活、非模板化地进行空间推理。
  • CoT 推理:生成推理轨迹,使 VLM 能够基于现实世界对象先验和视觉线索估算距离。
  • Lerobot 集成:兼容 VlmClient 协议,可在机器人学习流水线中作为奖励或 CoT 来源使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目