remyxai/VQASynth
Compose multimodal datasets 🎹
解决的问题
VQASynth 旨在解决 AI 预训练数据集中高质量空间推理数据稀缺的问题。它允许用户将标准图像数据集转换为专注于 3D 空间关系、距离和方向的视觉问答(VQA)数据集,这些对于具身 AI 和机器人技术至关重要。
工作原理
该项目实现了一个融合语义与度量数据的合成空间 VQA 对生成管道。该过程包括:
- 定位:使用 Florence-2 和 SAM2 等工具检测并分割与任务相关的对象。
- 3D 重建:使用 VGGT 将图像提升至 3D,生成每个对象的点云、深度图和内参。
- VQA 生成:使用提示生成器基于重建的 3D 场景生成问题-答案对,通常结合链式思维(CoT)推理以提高准确性。
此外,项目还提供了一种基于代理的方法(通过 NOOA),能够动态组合工具调用(例如,度量深度、对象方向、区域描述),无需遵循预设模板即可实时回答空间问题。
适用人群
- AI 研究人员:从事视觉-语言模型(VLM)和空间推理的研究者。
- 机器人开发者:需要理解物理环境中 3D 距离和对象方向的具身 AI 开发工程师。
- 数据集策展人:希望为现有图像数据集添加基于现实的空间标注的用户。
主要亮点
- 度量深度集成:用 VGGT 替代 DepthPro,实现更快、更准确的度量深度估计。
- 合成数据生成:能够生成 SpaceOm 和 SpaceThinker 等数据集,用于 VLM 的指令微调。
- 动态工具组合:代理版本支持通过多种工具(例如,Orient-Anything、MediaPipe 姿态关键点)灵活、非模板化地进行空间推理。
- CoT 推理:生成推理轨迹,使 VLM 能够基于现实世界对象先验和视觉线索估算距离。
- Lerobot 集成:兼容
VlmClient协议,可在机器人学习流水线中作为奖励或 CoT 来源使用。
相关
- 项目
- 项目
- 项目
- 项目
- 项目