nv-tlabs/vipe

ViPE: Video Pose Engine for Geometric 3D Perception

解決的問題

ViPE 解決了從原始、無約束影片中提取精確 3D 空間資訊的挑戰。使用者無需特殊硬體,即可自動標註相機位姿並產生密集深度圖,支援多種鏡頭類型,包括針孔、廣角與 360 度全景。

工作原理

ViPE 作為一個空間 AI 引擎,從影片中估計三個關鍵元件:相機內參(相機內部設定)、相機運動(相機的移動路徑)以及密集近似度量深度圖(物體與相機之間的距離)。

適用對象

本工具專為從事 3D 感知、電腦視覺與空間 AI 的開發者與研究人員設計,適用於需要將原始影片轉換為結構化 3D 資料的場景。

主要亮點

  • 廣泛鏡頭支援:支援針孔、廣角與 360 度全景影片。
  • 多種管道選項:可與 Depth-Anything 3 和 Lyra 等多種管道整合。
  • 高效率:最新更新引入 CUDA 融合內核與管道快取,大幅加速運算。
  • 開源:可透過 PyPI 輕鬆安裝。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案