facebookresearch/map-anything
MapAnything: Universal Feed-Forward Metric 3D Reconstruction
해결하는 문제
MapAnything는 메트릭 3D 재구성을 위한 유니버설 프레임워크를 제공합니다. 이는 각 작업마다 별도의 전문 도구를 사용하는 대신, 단일 통합 피드포워드 모델을 사용하여 멀티 이미지 구조 복원(SfM), 멀티뷰 스테레오, 단안 메트릭 깊이 추정 및 레지스트레이션과 같은 다양한 3D 작업을 수행하는 과제를 해결합니다.
작동 원리
이 프로젝트의 핵심은 장면의 분해된 메트릭 3D 기하학을 회귀하는 엔드 투 엔드 학습 트랜스포머 모델을 사용합니다. 입력에 대해 매우 유연하여 사용자가 이미지, 카메라 캘리브레이션(내부 파라미터 또는 광선 방향), 카메라 포즈 또는 깊이 지도의 임의의 조합을 제공할 수 있습니다. 이 프레임워크는 모듈식으로 설계되어 통합 인터페이스를 통해 다른 3D 재구성 모델(DUSt3R, MASt3R, VGGT 등)을 래핑할 수 있으며, 모든 출력이 일관된 형식(예: 3D 포인트, 카메라 포즈 및 신뢰도 점수)을 따르도록 보장합니다.
대상 사용자
이 프레임워크는 다양한 입력 모달리티에 걸쳐 메트릭 3D 재구성을 위한 다재다능한 도구가 필요한 3D 컴퓨터 비전, 로보틱스 및 공간 AI 분야의 연구자와 개발자를 대상으로 합니다.
주요 특징
- 유니버설 모델: 12가지 이상의 서로 다른 3D 재구성 작업을 지원하는 단일 피드포워드 모델.
- 멀티모달 유연성: 이미지, 캘리브레이션, 깊이 및 포즈의 임의의 조합을 입력으로 지원.
- 모듈형 설계: 다양한 외부 3D 재구성 모델을 교체하여 사용할 수 있는 통합 인터페이스.
- 메모리 효율성: 하이엔드 GPU에서 최대 2,000개의 뷰를 처리할 수 있는 메모리 효율적인 추론 모드 포함.
- 포괄적인 스택: 데이터 처리, 학습, 추론 및 프로파일링을 포함하는 완전한 파이프라인 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트