ByteDance-Seed/Depth-Anything-3

Depth Anything 3

解決的問題

Depth Anything 3 (DA3) 解決了從任意視覺輸入中恢復空間上一致的 3D 幾何結構的挑戰。它簡化了深度與姿態估計的過程,讓使用者無需複雜的多任務學習架構,即可從單張影像(單目)或多張影像(多視角)中預測深度圖與相機位置。

工作原理

DA3 使用單一的普通 Transformer 主幹網絡(例如原始的 DINO 編碼器)與統一的深度-射線表示。此方法消除了對架構專業化的需要。模型可根據輸入配置靈活配置為執行不同任務,包括單目與多視角深度估計、相機姿態估計,以及用於新視角合成的 3D 高斯估計。

適用對象

本專案專為從事電腦視覺、3D 重構、機器人技術以及創意工作流程(如 Blender 或 VR/WebXR 查看器)的研究人員與開發者設計,適用於需要從影像或影片中恢復高保真深度與幾何結構的使用者。

主要亮點

  • 統一的模型庫:提供多種模型,包括主系列(適用於通用幾何任務)、度量系列(適用於真實世界尺度的深度)和單目系列(適用於相對深度)。
  • 多功能能力:支援單目深度估計、多視角深度估計、姿態條件深度、相機姿態估計與 3D 高斯估計。
  • DA3-Streaming:透過滑動視窗串流處理,僅需不到 12GB 的 GPU 記憶體即可實現超長影片序列的推論。
  • 全面的工具鏈:包含互動式 Gradio Web UI、靈活的命令列介面(CLI)用於批次處理,以及 .glb.ply.npz 等多種匯出格式。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案