ByteDance-Seed/Depth-Anything-3

Depth Anything 3

何を解決するか

Depth Anything 3 (DA3) は、任意の視覚入力から空間的に一貫した3Dジオメトリを回復する課題に対処します。深度とポーズ推定のプロセスを簡素化し、複雑なマルチタスク学習アーキテクチャを必要とせずに、単一画像(モノクロナル)または複数画像(マルチビュー)から深度マップとカメラ位置を予測できるようにします。

動作方法

DA3 は単一のシンプルなトランスフォーマーベース(たとえば、vanilla DINOエンコーダ)と統一された深度-レイ表現を使用します。このアプローチにより、アーキテクチャの専門化が不要になります。モデルは入力構成に応じて、モノクロナルおよびマルチビュー深度推定、カメラポーズ推定、新規ビュー合成用の3Dガウス推定など、さまざまなタスクを実行できるように構成できます。

対象ユーザー

本プロジェクトは、コンピュータビジョン、3D再構築、ロボティクス、クリエイティブパイプライン(BlenderやVR/WebXRビューアなど)で作業する研究者や開発者向けです。画像や動画から高精度な深度とジオメトリを回復する必要がある方々に最適です。

特徴

  • 統一されたモデルズー: 一般のジオメトリタスク向けのメインシリーズ、現実世界スケールの深度向けのメトリックシリーズ、相対深度向けのモノクロナルシリーズを含む、さまざまなモデルを提供。
  • 多様な機能: モノクロナル深度推定、マルチビュー深度推定、ポーズ条件付き深度、カメラポーズ推定、3Dガウス推定をサポート。
  • DA3-Streaming: スライディングウィンドウストリーミングにより、12GB未満のGPUメモリで超長動画シーケンスの推論が可能。
  • 包括的なツールキット: インタラクティブなGradioウェブUI、バッチ処理向けの柔軟なCLI、および .glb.ply.npz などの複数のエクスポートフォーマットを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト