ByteDance-Seed/Depth-Anything-3

Depth Anything 3

解决的问题

Depth Anything 3 (DA3) 解决了从任意视觉输入中恢复空间一致的 3D 几何结构的挑战。它简化了深度和姿态估计的过程,使用户无需复杂的多任务学习架构,即可从单张图像(单目)或多张图像(多视图)中预测深度图和相机位置。

工作原理

DA3 使用单一的普通 Transformer 主干网络(如原始的 DINO 编码器)和统一的深度-射线表示。这种方法消除了对架构专业化的需要。模型可根据输入配置灵活配置为执行不同任务,包括单目和多视图深度估计、相机姿态估计,以及用于新视角合成的 3D 高斯估计。

适用人群

本项目专为从事计算机视觉、3D 重建、机器人技术以及创意工作流(如 Blender 或 VR/WebXR 查看器)的研究人员和开发者设计,适用于需要从图像或视频中恢复高保真深度和几何结构的用户。

主要亮点

  • 统一的模型库:提供多种模型,包括主系列(适用于通用几何任务)、度量系列(适用于真实世界尺度的深度)和单目系列(适用于相对深度)。
  • 多功能能力:支持单目深度估计、多视图深度估计、姿态条件深度、相机姿态估计和 3D 高斯估计。
  • DA3-Streaming:通过滑动窗口流式处理,仅需不到 12GB 的 GPU 内存即可实现超长视频序列的推理。
  • 全面的工具链:包含交互式 Gradio Web UI、灵活的命令行接口(CLI)用于批量处理,以及 .glb.ply.npz 等多种导出格式。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目