kocasariumut/FaceAnything

Official Implementation for "Face Anything: 4D Face Reconstruction from Any Image Sequence" (ECCV 2026, Oral (Spotlight))

What it is

Face Anything은 연구급 피드포워드 신경망 모델로, 모든 얼굴 이미지 컬렉션(사진 연사, 비디오, 또는 단일 사진)을 시간적으로 일관된 4D 재구성—시간에 따라 움직이는 3D 기하학적 구조와 밀집한 픽셀별 대응 관계—로 변환합니다. 핵심 아이디어는 canonical facial point prediction입니다. 모든 픽셀을 공유된 표준 얼굴 공간의 정규화된 좌표로 매핑하여, 트래킹과 재구성을 단일한 밀집 매핑 문제로 전환합니다.

What you get out of it

제공된 run_inference.py를 입력 시퀀스에 실행하면 다음과 같은 시각적 결과물을 생성합니다:

  • 彩色 (Color) 포인트 클라우드 비디오 (orbiting camera) 재구성된 얼굴을 보여줍니다.

  • Track videos 각 포인트가 프레임 간에 일관된 색상을 유지하여 밀집한 대응 관계를를 시각화합니다.

  • Canonical-coloured renders 표준 좌표에 따라 각 포인트를 색상으로 표시한 렌더링입니다.

  • Depth, normal and raw map videos 분석 또는 다운스트림 작업용 깊이, 법선 및 원본 맵 비디오입니다.

  • A “grand tour” 비디오가 모든 모달리티를 부드럽게 변환하며 보여줍니다.

  • 프레임별 PLY files (기하학, 표준 맵, 트래킹) 및 카메라 내/외적 파라미터 (cameras.npz/json).

  • A raw_predictions.npz 파일이 모델의 원본 출력(깊이, 포즈, 표준 맵, 신뢰도, 유효성 마스크)을 포함합니다.

모든 결과물은 출력 폴더에 자동으로 저장됩니다. --outputs 플래그를 사용하여 일부만 선택할 수 있습니다.

How to get it running

  1. Clone the repo 및 제공된 install.sh를 실행합니다. 이 스크립트는 Conda 환경을 สร้าง, PyTorch 2.9 (CUDA 12.8) 및 기타 Python 의존성을 설치하고, 약 15 GB의 모델 체크포인트를 다운로드합니다.
  2. GPU requirement – 모델은 CUDA 지원 GPU가 필요합니다. Python 3.11에서만 테스트되었습니다.
  3. Checkpoint – 스크립트는 Google Drive 또는 Hugging-Face repo에서 checkpoint.pt를 추출합니다. 파일을 checkpoints/ 아래에 수동으로 배치할 수도 있습니다.
  4. Run inference 단일 명령으로 실행합니다:
    python run_inference.py --input <path> --output <out_dir>
    
    <path>는 단일 이미지, 이미지 폴더, 또는 비디오 파일입니다.
  5. Optional flags를 통해 해상도, 처리 모드 (all-at-once vs one-by-one), 배경 제거 (Robust Video Matting을 통해), 출력 생성물, 궤도 스타일 등을 제어할 수 있습니다.

When you'd want to use it

  • Research 4D 얼굴 동역학, 표정 전이, 또는 밀집하고 시간적으로 일관된 기하학적 구조가 필요한 애니메이션 연구.

  • Content creation 게임이나 AR/VR을 위한 콘텐츠 제작, 즉 캐주얼한 영상에서 3D 얼굴 모델로의 빠른 턴키 파이프라인이 유용한 경우.

  • Dataset generation – 저자들은 선별된 “FaceAnything NeRSemble” 데이터셋을 위한 표준 맵을 공개합니다 (요청 양식을 통해 액세스 가능).

Limitations & practical notes

  • 모델은 **피드포워드 방식(feed-forward only)**입니다. 반복적인 정교화 과정을 거치지 않으므로, multi-view SfM 파이프라인과 비교하여 매우 높은 주파수의 디테일이 누락될 수 있습니다.

  • Memory vs detail trade-off: all-at-once 모드는 더 부림드러운 시간적 일관성을 제공하지만 표면이 거칠고, one-by-one 모드는 일관성 및 더 높은 GPU 메모리 사용량의 대가로 더 정밀한 기하학적 구조를를 시각화합니다.

  • 라이선스는 CC-BY-NC 4.0입니다. 따라서 허가 없이 상업적 이용은 금지됩니다.


Citation

@article{kocasari2026face,
  title={Face Anything: 4D Face Reconstruction from Any Image Sequence},
  author={Kocasari, Umut and Giebenhain, Simon and Shaw, Richard and Nießner, Matthias},
  journal={arXiv preprint arXiv:2604.19702},
  year={2026}
}

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트