zju3dv/neuralbody
Code for "Neural Body: Implicit Neural Representations with Structured Latent Codes for Novel View Synthesis of Dynamic Humans" CVPR 2021 best paper candidate
Neural Body – 동적 인체를 위한 암시적 신경 표현
개요
- 다중 시점 비디오에서 움직이는 인체의 연속적인 3D 표현을 학습하는 연구용 코드베이스입니다. 암시적 신경 필드(3‑D 좌표를 색상/점유율로 매핑하는 신경망)와 포즈 의존적 기하학을 인코딩하는 구조화된 잠재 코드를 사용합니다.
- 목표는 새로운 시점 합성입니다. 보정된 몇 대의 카메라만 있으면, 학습 중에 보지 못한 포즈라도 모델이 어떤 새로운 시점에서든 인물을 렌더링할 수 있습니다.
주요 기능
- 학습: 두 가지 공개 데이터셋 지원
- ZJU‑MoCap – 단일 배우가 여러 동작을 수행하는 다중 시점 캡처 데이터.
- People‑Snapshot – 다양한 인물의 짧은 비디오 모음.
- 추론: 다음 기능 지원
- 단일 프레임의 새로운 시점 렌더링.
- 고정 또는 회전 카메라에서 움직이는 인물의 비디오 렌더링.
- 모든 프레임에서 신체 메시 추출.
- 보지 못한 포즈(새로운 동작으로의 일반화) 및 흰색 배경 렌더링 지원.
- PyTorch의
torch.distributed를 통한 분산 학습 및 즉시 사용 가능한 Docker 이미지 제공.
시작하기
- 설치 –
INSTALL.md에 따라 수동으로 conda 설정을 하거나docker/내의 Dockerfile을 사용하세요(Zhaoyi Wan님께 감사드립니다). - 데이터 다운로드 – README에는 ZJU‑MoCap 및 People‑Snapshot 데이터셋을 가져오는 스크립트와 Google Drive에 호스팅된 사전 학습된 체크포인트 링크가 있습니다.
- 예제 실행 – 저장소에는 즉시 사용 가능한 셸 스크립트가 포함되어 있습니다:
visualize.sh는 새로운 시점, 포즈가 변하는 비디오, 메시를 렌더링하는 방법을 보여줍니다.train.sh및test.sh는 단일 GPU 및 다중 GPU 학습/평가 명령을 설명합니다.
- 사용자 정의 데이터 –
tools/custom폴더에서 파이프라인을 자신의 다중 시점 캡처 데이터에 맞게 조정하는 방법을 설명합니다.
데이터셋 및 리소스
- ZJU‑MoCap – SMPL 매개변수(EasyMocap으로 피팅)가 포함된 다중 시점 캡처. 저장소는 원본 세트와 더 새로운 SMPL 피팅 세트를 모두 제공합니다.
- People‑Snapshot – 야외 비디오; 저장소에는 처리 스크립트(
process_snapshot.py)와 SMPL 매개변수 시각화 도구가 포함되어 있습니다. - Mobile‑Stage 및 SyntheticHuman++ 데이터셋은 2024년 1월에 발표되었습니다(액세스를 위한 Google 폼 링크 제공).
일반적인 워크플로우
# 1. 데이터 준비 (예: People‑Snapshot)
python tools/process_snapshot.py --input path/to/video
# 2. 학습 (단일 GPU)
python train_net.py --cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
exp_name female3c resume False
# 3. 프레임의 새로운 시점 시각화
python run.py --type visualize \
--cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
exp_name female3c vis_novel_view True num_render_views 144
# 4. 메시 렌더링
python run.py --type visualize \
--cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
exp_name female3c vis_mesh True
사용 대상
- 신경 렌더링, 인체 형태/포즈 모델링 또는 새로운 시점 합성을 연구하는 연구자.
- 희소 다중 카메라 설정에서 사진처럼 사실적인 아바타를 생성하기 위한 베이스라인이 필요한 개발자.
- 비디오에서 애니메이션 가능한 3‑D 메시를 추출하는 데 관심이 있는 모든 사람.
인용 이 코드나 사전 학습된 모델을 사용하는 경우, CVPR 2021 및 TPAMI 2023 논문을 인용하십시오(BibTeX는 README에 제공됨).
위의 모든 정보는 저장소의 README에서 직접 가져온 것이며, 외부 가정은 추가되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트