zju3dv/Diffuman4D

[ICCV 2025] Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models

What it solves

Diffuman4D는 희소한 뷰의 비디오로부터 고충실도, 4D 일관성 인간 뷰 합성을 수행하는 과제를 해결합니다. 사용자는 프레임 간 시간적 일관성을 유지하면서 임의의 시점(자유 시점 렌더링)에서 인간의 퍼포먼스를 렌더링할 수 있습니다.

How it works

이 프로젝트는 시공간 확산 모델을 사용하여 제한된 수의 입력 카메라로부터 일관된 인간 뷰를 생성합니다. 시스템은 희소한 입력을 통해 3D 이미지 그리드(단일 프레임) 또는 4D 이미지 그리드(프레임 시퀀스)를 생성할 수 있습니다. 이렇게 생성된 뷰는 몰입형 렌더링을 위한 고품질 3D 또는 4D Gaussian Splatting (3DGS/4DGS) 모델을 재구성하는 데 사용될 수 있습니다.

Who it’s for

제한된 카메라 설정에서 인간의 퍼포먼스의 새로운 시점을 합성해야 하는 컴퓨터 비전, 인간 중심 3D/4D 생성 및 몰입형 미디어 분야의 연구자 및 개발자.

Highlights

  • Spatio-Temporal Diffusion: 확산 모델을 사용하여 공간(서로 다른 뷰)과 시간(프레임) 모두에서 일관성을 보장합니다.
  • Sparse-to-Dense View Synthesis: 희소한 뷰의 비디오(예: 4개의 입력 카메라)를 밀집된 뷰 그리드(예: 44개의 카메라)로 변환할 수 있습니다.
  • Processed DNA-Rendering Dataset: 1000개 이상의 인간 멀티뷰 비디오 시퀀스(전경 마스크 및 스켈레톤 데이터 포함)가 포함된 정교하게 재어노테이션된 DNA-Rendering 데이터셋을 제공합니다.
  • 4DGS Integration: 생성된 뷰로부터 4D Gaussian Splatting 모델을 재구성하는 워크플로우를 지원합니다.