facebookresearch/vggt-omega
[CVPR 2026 Oral] VGGT Omega
해결하는 문제
VGGT-Ω는 이미지 집합에서 카메라 자세와 깊이를 추정할 수 있는 방법을 제공하여 2차원 시각 데이터에서 3차원 장면을 재구성할 수 있게 합니다.
작동 방식
이 프로젝트는 사전 학습된 트랜스포머 기반 모델(1B 파라미터 버전 제공)을 사용하며, 이미지를 입력으로 받아 자세 인코딩, 깊이 맵, 깊이 신뢰도를 예측합니다. 이러한 예측 결과는 카메라 외부 및 내부 파라미터로 변환되어 3차원 포인트 클라우드를 생성하고 GLB 파일로 장면을 시각화합니다.
대상 사용자
컴퓨터 비전, 3차원 재구성, 공간형 AI 분야에서 일하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 엔드투엔드 추론: 이미지에서 카메라 파라미터와 깊이를 동시에 예측합니다.
- 텍스트 정렬 지원: 텍스트 정렬된 임베딩용 특별한 체크포인트 제공.
- 3차원 시각화: 깊이를 재투영하지 않은 포인트 클라우드와 예측된 카메라를 GLB 장면으로 시각화하는 Gradio 데모 포함.
- 확장 가능한 메모리 사용량: 입력 프레임 수에 따라 GPU 메모리 사용량을 세부적으로 벤치마킹합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트