nicolasvonluetzow/GaussianGPT

[ECCV'26 Oral] Our method creates 3D Gaussian scenes completely autoregressively, allowing for generation, completion, and outpainting with the same model.

해결하는 문제

GaussianGPT는 확산 또는 플로우 매칭 모델을 벗어나 3D 장면 생성의 도전 과제를 해결합니다. 대신, 3D 가우시안 원소를 완전히 순차적으로 생성하는 자동회귀적 접근 방식을 사용하여 단계별 장면 구축을 가능하게 합니다. 이는 장면 완성, 외연 생성, 제어 가능한 샘플링과 같은 기능을 더 자연스럽게 지원하며, 이는 전반적인 개선 방법보다 자동회귀적 트랜스포머에 더 적합합니다.

작동 방식

이 프로젝트는 두 단계 파이프라인을 구현합니다:

  1. VQ-VAE: 벡터 양자화를 사용하는 희소 3D 컨볼루션 오토인코더는 3D 가우시안 원소를 이산 토큰으로 압축합니다. 이는 gsplat를 통해 재렌더링 손실을 사용하여 훈련됩니다.
  2. GPT: 3D 회전 위치 임베딩을 갖춘 자동회귀적 트랜스포머는 다음 토큰 예측을 통해 이러한 토큰 스트림을 모델링합니다.

추론 중에는 GPT가 토큰을 샘플링하고, 고정된 VQ-VAE가 이를 다시 3D 가우시안으로 디코딩한 후 표준 신경 렌더링 파이프라인을 사용하여 렌더링합니다.

대상 사용자

3D 생성형 AI, 신경 렌더링 및 합성 3D 환경 생성에 종사하는 연구자 및 개발자입니다.

주요 특징

  • 자동회귀 생성: 전체 장면을 한 번에 개선하는 대신, 순차적으로 3D 장면을 생성합니다.
  • 유연한 제어: 외연 생성, 장면 완성, 온도 기반 샘플링을 지원합니다.
  • 이산 잠재 그리드: 공간 구조와 시각적 특성을 토큰화하기 위해 희소 3D CNN을 사용합니다.
  • 확장 가능한 아키텍처: 트랜스포머의 조합적 인덕티브 편향을 활용하여 3D 장면 생성에 적합합니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트