nv-tlabs/vipe
ViPE: Video Pose Engine for Geometric 3D Perception
解决的问题
ViPE 解决了从原始、无约束视频中提取精确 3D 空间信息的挑战。用户无需专用硬件,即可自动标注相机位姿并生成密集深度图,支持多种镜头类型,包括针孔、广角和 360 度全景。
工作原理
ViPE 作为一个空间 AI 引擎,从视频中估计三个关键组件:相机内参(相机内部设置)、相机运动(相机的运动轨迹)以及密集近似度量深度图(物体与相机之间的距离)。
适用人群
本工具专为从事 3D 感知、计算机视觉和空间 AI 的开发者与研究人员设计,适用于需要将原始视频转换为结构化 3D 数据的场景。
主要亮点
- 广泛镜头支持:支持针孔、广角和 360 度全景视频。
- 多种管道选项:可与 Depth-Anything 3 和 Lyra 等多种管道集成。
- 高性能:最新更新引入 CUDA 融合内核和管道缓存,显著提升速度。
- 开源:可通过 PyPI 轻松安装。
相关
- 项目
- 项目
- 项目
- 项目
- 项目