amap-cvlab/ABot-Recon

Streaming 3D reconstruction from only video input: Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

해결하는 문제

ABot-Recon은 장기 스트리밍 3D 재구성의 과제를 해결합니다. 기존 방법들은 장거리 상태나 메모리를 유지하기 위해 복잡한 메커니즘에 의존하는 경우가 많아, 시퀀스 길이가 길어질수록 계산 비용이 급증합니다. ABot-Recon은 장기 시퀀스에 관계없이 효율성과 일정한 메모리 사용량을 유지하기 위해 국소적 컨텍스트에 집중함으로써 이를 단순화합니다.

작동 방식

지속적인 장거리 메모리 대신 고정된 12프레임의 국소 컨텍스트 창을 사용합니다. 각 시간 단계에서 다음을 수행합니다:

  1. KV 캐시: 이전 11프레임의 Key-Value (KV) 특징을 캐시합니다.
  2. 기하 예측: 현재 카메라 좌표계에서 포인트 맵을 예측합니다.
  3. 자세 추정: 현재 프레임과 이전 프레임 사이의 상대 자세를 추정합니다.
  4. 글로벌 조합: 이러한 상대 자세를 순차적으로 조합하여 글로벌 궤적과 포인트 클라우드를 복원합니다.

장시간 시퀀스에서의 드리프트를 최소화하기 위해 경량의 모션-비전 회전 보정기와 조합 인식형 자세 손실을 사용합니다. 카메라가 이미 방문한 영역을 다시 방문할 경우, 옵션으로 루프 클로저 백엔드(DINOv2-SALAD 기술자)를 사용하여 궤적을 추가로 정밀화할 수 있습니다.

대상 사용자

컴퓨터 비전, 로보틱스, 3D 재구성 분야에서 동영상 스트림으로부터 맵핑 및 궤적 추정을 수행할 때 메모리 효율적이고 스트리밍 가능한 접근이 필요한 연구자 및 개발자.

주요 특징

  • 일정한 메모리 사용량: 프레임당 계산 및 모델 상태 메모리는 시퀀스 길이에 관계없이 일정합니다.
  • 고효율성: NVIDIA H100에서 최대 24.45 FPS를 달성합니다.
  • 국소 중심 접근법: 12프레임의 국소 컨텍스트 창만을 사용하여 장시간 동영상 스트림을 재구성합니다.
  • 옵션 루프 클로저: 재방문 영역에 대해 희소 포즈 그래프 최적화를 통해 궤적을 정밀화하는 기능을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트