Visionary-Laboratory/holi-spatial

[ICML 2026 Oral] Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

解决的问题

Holi-Spatial 旨在将原始视频流转换为全面的 3D 空间智能系统。它解决了从视频创建高质量、带注释的 3D 场景的挑战,使模型能够理解 3D 环境中的空间关系、对象实例和功能区域。

工作原理

该项目实现了一个多阶段流水线,用于处理来自 ScanNet、ScanNet++ 和 DL3DV 等数据集的视频数据:

  1. 几何优化:使用 Depth Anything 3 (DA3) 进行深度和点云初始化,随后通过 PGSR/3DGS 训练创建 3D Gaussian Splatting 几何形状。
  2. 图像级感知:利用 VLM (视觉语言模型) 发现对象类别和区域,并使用 SAM3 生成精确的图像掩码。 n3. 场景级提升与精炼:将 2D 掩码提升到 3D 空间,合并并过滤 3D 边界框,为实例生成描述,并合成空间问答 (QA) 对。

适用对象

致力于 3D 视觉、具身智能 (Embodied AI) 和多模态 LLM 的研究人员和开发人员,他们需要一个能够为训练视觉语言模型生成丰富注释的 3D 空间数据集的流水线。

亮点

  • 端到端流水线:将视频流转换为 3DGS 几何形状、网格和 3D 边界框注释。
  • 大规模数据集生成:能够生成数百万个空间 QA 对(例如 HoliSpatial-QA-2M 数据集)。
  • 与基础模型集成:利用 SAM3、Depth Anything 3 和 Qwen3-VL 进行感知和注释。
  • SFT 就绪:包含将生成的 QA 数据转换为与 LLaMA-Factory 兼容的格式以进行监督微调 (SFT) 的工具。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目