ByteDance-Seed/Depth-Anything-3

Depth Anything 3

해결하는 문제

Depth Anything 3 (DA3)는 임의의 시각 입력에서 공간적으로 일관된 3D 기하를 복원하는 문제를 해결합니다. 복잡한 다중 작업 학습 아키텍처를 필요로 하지 않고도 단일 이미지(모노클러널) 또는 다중 이미지(다중 뷰)에서 깊이 맵과 카메라 위치를 예측할 수 있도록 깊이 및 자세 추정 과정을 단순화합니다.

작동 방식

DA3는 단일 일반적인 트랜스포머 백본(예: 순수한 DINO 인코더)과 통합된 깊이-레이 표현을 사용합니다. 이 접근법은 아키텍처 전문화가 필요 없도록 합니다. 모델은 입력 구성에 따라 단일 및 다중 뷰 깊이 추정, 카메라 자세 추정, 새로운 뷰 합성용 3D 가우시안 추정 등 다양한 작업을 수행할 수 있도록 구성할 수 있습니다.

대상 사용자

이 프로젝트는 컴퓨터 비전, 3D 재구성, 로보틱스, 크리에이티브 파이프라인(Blender 또는 VR/WebXR 뷰어 등)에서 일하는 연구자 및 개발자들을 위한 것입니다. 이미지나 비디오에서 고정밀 깊이 및 기하 구조를 회복해야 하는 분들에게 적합합니다.

주요 특징

  • 통합 모델 라이브러리: 일반적인 기하 작업용 메인 시리즈, 실제 세계 스케일 깊이용 메트릭 시리즈, 상대 깊이용 모노클러널 시리즈를 포함한 다양한 모델 제공.
  • 다양한 기능: 모노클러널 깊이 추정, 다중 뷰 깊이 추정, 자세 조건부 깊이, 카메라 자세 추정, 3D 가우시안 추정 지원.
  • DA3-Streaming: 슬라이딩 윈도우 스트리밍을 통해 12GB 미만의 GPU 메모리로 초장시간 비디오 시퀀스 추론 가능.
  • 포괄적인 도구 세트: 인터랙티브한 Gradio 웹 UI, 배치 처리를 위한 유연한 CLI, 그리고 .glb, .ply, .npz 등의 다양한 내보내기 형식 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트