nv-tlabs/vipe

ViPE: Video Pose Engine for Geometric 3D Perception

해결하는 문제

ViPE는 제약 없는 원시 동영상에서 정밀한 3차원 공간 정보를 추출하는 문제를 해결합니다. 전용 하드웨어 없이도 카메라 자세를 자동으로 주석 처리하고 밀도 높은 깊이 맵을 생성할 수 있으며, 핀홀, 와이드 앵글, 360도 파노라마 등 다양한 렌즈 유형을 지원합니다.

작동 방식

ViPE는 동영상에서 세 가지 핵심 요소를 추정하는 공간 AI 엔진으로서, 카메라 내부 파라미터(카메라의 내부 설정), 카메라 움직임(카메라의 이동 경로), 그리고 밀도 높은 근사 메트릭 깊이 맵(물체와 카메라 사이의 거리)을 추정합니다.

대상 사용자

3D 인식, 컴퓨터 비전, 공간 AI 분야에서 일하는 개발자 및 연구자에게 적합합니다. 원시 동영상을 구조화된 3D 데이터로 변환해야 하는 분들에게 이상적입니다.

주요 특징

  • 다양한 렌즈 지원: 핀홀, 와이드 앵글, 360도 파노라마 동영상 모두 지원.
  • 다양한 파이프라인 옵션: Depth-Anything 3 및 Lyra와 같은 다양한 파이프라인과 통합 가능.
  • 고성능: 최신 업데이트에서 CUDA 융합 커널과 파이프라인 캐싱을 도입하여 성능을 크게 향상.
  • 오픈소스: PyPI를 통해 쉽게 설치 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트