nv-tlabs/vipe

ViPE: Video Pose Engine for Geometric 3D Perception

何を解決するか

ViPEは、制約のない生の動画から正確な3D空間情報を抽出する課題に対処します。専用ハードウェアを必要とせず、カメラの姿勢を自動的にアノテーションし、密集した深度マップを生成できます。ピンホール、広角、360度パノラマなど、さまざまなレンズタイプに対応しています。

動作方法

ViPEは、動画から以下の3つの主要な要素を推定する空間AIエンジンとして機能します:カメラ内部パラメータ(カメラの内部設定)、カメラの運動(カメラの移動経路)、および密集した近似メトリック深度マップ(物体とカメラとの距離)。

対象ユーザー

3D認識、コンピュータビジョン、空間AIに取り組む開発者や研究者向けに設計されています。生の動画を構造化された3Dデータに変換する必要がある方々に最適です。

特徴

  • 広範なレンズ対応:ピンホール、広角、360度パノラマの動画に対応。
  • 複数のパイプライン対応:Depth-Anything 3やLyraなど、さまざまなパイプラインと統合可能。
  • 高いパフォーマンス:最近の更新でCUDA融合カーネルとパイプラインキャッシュを導入し、大幅な高速化を実現。
  • オープンソース:PyPI経由で簡単にインストール可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト