AIGeeksGroup/3D-R1

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding

解决的问题

3D-R1 解决了当前 3D 视觉-语言模型(VLM)面临的局限性,这些模型由于缺乏高质量的空间数据和静态视角假设,常常在鲁棒推理和泛化能力上表现不佳。它旨在提供一种统一的 3D 场景理解方法,涵盖密集描述、视觉定位、3D 问答等任务。

工作原理

3D-R1 采用多阶段训练和架构方法:

  • 冷启动初始化: 使用 Scene-30K 这一高质量合成数据集,该数据集基于 Gemini 2.5 Pro 构建的数据引擎生成,包含 Chain-of-Thought(CoT)推理。
  • 强化学习(RL): 通过 GRPO 等 RLHF 策略进一步优化模型。利用三种特定奖励函数——感知奖励、语义相似性奖励和格式奖励——确保检测准确性和语义精确性。
  • 动态视角选择: 不依赖静态视角,而是自适应地选择最能提供信息的视角来理解 3D 场景。
  • 骨干网络: 采用 Qwen2.5-VL-7B-Instruct 模型作为基础大语言模型(LLM)。

适用人群

本项目专为从事 3D 计算机视觉、空间人工智能以及大语言模型与 3D 场景感知融合的研究人员和开发者设计。

主要亮点

  • 统一的场景理解: 能够处理 3D-DC(密集描述)、3D-VG(视觉定位)、3D-QA(问答)、3D 对话、3D 推理和 3D 规划等任务。
  • 合成 CoT 数据: 引入 Scene-30K,以填补高质量 3D 空间推理数据的空白。
  • RL 增强推理: 使用 GRPO 和专用奖励函数提升推理能力。
  • 零样本泛化: 在无需任务特定训练的情况下,对复杂场景表现出强大性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目