facebookresearch/meshflow

Repository for the CVPR 2026 paper MeshFlow Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer by Weiyu Li, Antoine Toisoul, Tom Monnier, Roman Shapovalov, Rakesh Ranjan, Ping Tan and Andrea Vedaldi.

해결하는 문제

MeshFlow는 고품질의 예술적인 3D 메쉬를 빠르게 생성하도록 설계되었습니다. 전문가가 제작한 듯한 상세한 3D 지오메트리를 생성하는 문제를 해결하여, 메쉬당 생성 시간을 약 1초로 단축합니다.

작동 원리

이 시스템은 변분 오토인코더(VAE)와 Diffusion Transformer(DiT)를 결합한 두 부분으로 구성된 아키텍처를 사용합니다:

  • MeshVAE: 메쉬의 토폴로지를 연속적인 잠재 공간으로 인코딩하고 이를 정점(vertices), 법선(normals) 및 인접 정보로 다시 디코딩합니다.
  • MeshFlowDiT: 이러한 잠재 변수에서 작동하는 flow-matching Diffusion Transformer입니다. 입력 지오메트리(voxel RoPE 사용) 및 선택적 참조 이미지(DINOv3 시각적 인코더 사용)를 조건으로 사용할 수 있습니다.
  • 파이프라인: 엔드 투 엔드 프로세스에는 표면 샘플링, 잠재 공간에서의 flow matching 및 VAE를 통한 최종 디코딩이 포함됩니다.

대상 사용자

이 도구는 3D 아티스트, 컴퓨터 비전 연구자 및 지오메트리 또는 이미지 참조로부터 신속하고 고충실도인 3D 메쉬 생성이 필요한 애플리케이션을 구축하는 개발자를 위한 것입니다.

주요 특징

  • 고속: 약 1초 만에 예술적인 메쉬를 생성합니다.
  • 유연한 조건부 생성: 지오메트리 기반 조건부 생성과 참조 이미지 기반 조건부 생성 모두를 지원합니다.
  • DINOv3 통합: 이미지를 사용할 때 고품질 시각적 토큰을 위해 DINOv3와 통합됩니다.
  • 해상도 제어: 생성된 메쉬의 정점 수를 대략적으로 제어하는 메커니즘이 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch