guochengqian/Magic123

[ICLR'24] Official PyTorch Implementation of Magic123: One Image to High-Quality 3D Object Generation Using Both 2D and 3D Diffusion Priors

What it solves

Magic123은 단일 2D 이미지에서 고품질 3D 객체를 생성합니다. 하나의 확산 사전만 사용할 경우, 풍부한 디테일과 상상력을 추가하면서 3D 일관성을 유지하는 것이 어려운 문제를 해결합니다.

How it works

이 프로젝트는 2D와 3D 확산 사전을 결합한 공동 사전 접근 방식을 사용합니다. 거친 단계에서 세밀한 단계로 진행하는 파이프라인은 두 단계로 구성됩니다:

  1. Coarse Stage: NeRF(Neural Radiance Field)를 사용해 기본적인 기하와 형태를 설정합니다.
  2. Fine Stage: DMTet을 사용해 텍스처와 고해상도 디테일을 정교화합니다.

품질 향상을 위해, 이미지 내 특정 객체를 위한 특수 토큰을 생성하는 텍스트 인버전을 선택적으로 사용할 수 있으며, MiDaS를 통한 깊이 추정으로 기하를 안내합니다.

Who it’s for

단일 이미지를 텍스처가 입힌 3D 메쉬로 변환하고자 하는 3D 콘텐츠 제작, 컴퓨터 비전, 생성 AI 분야의 연구자 및 개발자를 위한 도구입니다.

Highlights

  • Joint Priors: 2D와 3D 확산 사전을 결합해 3D 일관성과 시각적 디테일의 균형을 맞춥니다.
  • Coarse-to-Fine Pipeline: 두 단계 프로세스(NeRF 후 DMTet)로 높은 품질의 출력을 제공합니다.
  • Mesh Export: 최종 객체를 .obj 파일로 내보낼 수 있으며, 재질과 텍스처를 포함해 Blender나 MeshLab에서 사용할 수 있습니다.
  • Customizable Guidance: 2D와 3D 사전 강도를 조정해 디테일과 일관성의 수준을 제어할 수 있습니다.