nv-tlabs/vipe
ViPE: Video Pose Engine for Geometric 3D Perception
解決的問題
ViPE 解決了從原始、無約束影片中提取精確 3D 空間資訊的挑戰。使用者無需特殊硬體,即可自動標註相機位姿並產生密集深度圖,支援多種鏡頭類型,包括針孔、廣角與 360 度全景。
工作原理
ViPE 作為一個空間 AI 引擎,從影片中估計三個關鍵元件:相機內參(相機內部設定)、相機運動(相機的移動路徑)以及密集近似度量深度圖(物體與相機之間的距離)。
適用對象
本工具專為從事 3D 感知、電腦視覺與空間 AI 的開發者與研究人員設計,適用於需要將原始影片轉換為結構化 3D 資料的場景。
主要亮點
- 廣泛鏡頭支援:支援針孔、廣角與 360 度全景影片。
- 多種管道選項:可與 Depth-Anything 3 和 Lyra 等多種管道整合。
- 高效率:最新更新引入 CUDA 融合內核與管道快取,大幅加速運算。
- 開源:可透過 PyPI 輕鬆安裝。
相關
- 專案
- 專案
- 專案
- 專案
- 專案