nv-tlabs/vipe

ViPE: Video Pose Engine for Geometric 3D Perception

解决的问题

ViPE 解决了从原始、无约束视频中提取精确 3D 空间信息的挑战。用户无需专用硬件,即可自动标注相机位姿并生成密集深度图,支持多种镜头类型,包括针孔、广角和 360 度全景。

工作原理

ViPE 作为一个空间 AI 引擎,从视频中估计三个关键组件:相机内参(相机内部设置)、相机运动(相机的运动轨迹)以及密集近似度量深度图(物体与相机之间的距离)。

适用人群

本工具专为从事 3D 感知、计算机视觉和空间 AI 的开发者与研究人员设计,适用于需要将原始视频转换为结构化 3D 数据的场景。

主要亮点

  • 广泛镜头支持:支持针孔、广角和 360 度全景视频。
  • 多种管道选项:可与 Depth-Anything 3 和 Lyra 等多种管道集成。
  • 高性能:最新更新引入 CUDA 融合内核和管道缓存,显著提升速度。
  • 开源:可通过 PyPI 轻松安装。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目