facebookresearch/vggt-omega

[CVPR 2026 Oral] VGGT Omega

해결하는 문제

VGGT-Ω는 이미지 집합에서 카메라 자세와 깊이를 추정할 수 있는 방법을 제공하여 2차원 시각 데이터에서 3차원 장면을 재구성할 수 있게 합니다.

작동 방식

이 프로젝트는 사전 학습된 트랜스포머 기반 모델(1B 파라미터 버전 제공)을 사용하며, 이미지를 입력으로 받아 자세 인코딩, 깊이 맵, 깊이 신뢰도를 예측합니다. 이러한 예측 결과는 카메라 외부 및 내부 파라미터로 변환되어 3차원 포인트 클라우드를 생성하고 GLB 파일로 장면을 시각화합니다.

대상 사용자

컴퓨터 비전, 3차원 재구성, 공간형 AI 분야에서 일하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 엔드투엔드 추론: 이미지에서 카메라 파라미터와 깊이를 동시에 예측합니다.
  • 텍스트 정렬 지원: 텍스트 정렬된 임베딩용 특별한 체크포인트 제공.
  • 3차원 시각화: 깊이를 재투영하지 않은 포인트 클라우드와 예측된 카메라를 GLB 장면으로 시각화하는 Gradio 데모 포함.
  • 확장 가능한 메모리 사용량: 입력 프레임 수에 따라 GPU 메모리 사용량을 세부적으로 벤치마킹합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트