Visionary-Laboratory/holi-spatial

[ICML 2026 Oral] Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

해결하는 문제

Holi-Spatial은 원시 비디오 스트림을 포괄적인 3D 공간 지능 시스템으로 변환하도록 설계되었습니다. 비디오로부터 고품질의 주석이 달린 3D 장면을 생성하는 과제를 해결하여, 모델이 3D 환경 내의 공간적 관계, 객체 인스턴스 및 기능 영역을 이해할 수 있도록 합니다.

작동 방식

이 프로젝트는 ScanNet, ScanNet++, DL3DV와 같은 데이터셋의 비디오 데이터를 처리하기 위해 다단계 파이프라인을 구현합니다:

  1. 기하학적 최적화: Depth Anything 3 (DA3)를 사용하여 깊이 및 포인트 클라우드 초기화를 수행한 다음, PGSR/3DGS 학습을 통해 3D Gaussian Splatting 지오메트리를 생성합니다.
  2. 이미지 수준 인지: VLM (Vision-Language Models)을 사용하여 객체 클래스 및 영역을 발견하고, SAM3를 사용하여 정밀한 이미지 마스크를 생성합니다.
  3. 장면 수준 리프트 및 정제: 2D 마스크를 3D 공간으로 리프트하고, 3D 바운딩 박스를 병합 및 필터링하며, 인스턴스에 대한 캡션을 생성하고, 공간 질의응답 (QA) 쌍을 합성합니다.

대상 사용자

3D 비전, Embodied AI 및 멀티모달 LLM을 연구하는 연구자와 개발자 중, 시각-언어 모델 학습을 위해 풍부하게 주석이 달린 3D 공간 데이터셋을 생성할 파이프라인이 필요한 분들.

주요 특징

  • 엔드 투 엔드 파이프라인: 비디오 스트림을 3DGS 지오메트리, 메쉬 및 3D 바운딩 박스 주석으로 변환합니다.
  • 대규모 데이터셋 생성: 수백만 개의 공간 QA 쌍(예: HoliSpatial-QA-2M 데이터셋)을 생성할 수 있습니다.
  • 파운데이션 모델 통합: 인지 및 주석을 위해 SAM3, Depth Anything 3 및 Qwen3-VL를 활용합니다.
  • SFT 준비 완료: 생성된 QA 데이터를 지도 미세 조정(SFT)을 위해 LLaMA-Factory와 호환되는 형식으로 변환하는 도구를 포함합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트