Tsinghua-MARS-Lab/SLAM-Former

[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer

해결하는 문제

SLAM-Former은 동시에 위치 추정과 지도 작성(SLAM)의 복잡성을 단일 Transformer 아키텍처로 통합함으로써 해결합니다. 이미지 시퀀스로부터 3D 재구성과 카메라 추적을 위한 간소화된 접근 방식을 제공합니다.

작동 방식

이 프로젝트는 이미지 시퀀스를 처리하여 SLAM을 수행하는 Transformer 기반 모델을 구현합니다. 추론 최적화를 위한 KV 프리닝과 출력의 격자 아티팩트를 줄이는 ConvHead 변형을 포함합니다. 시스템은 Rerun을 통한 실시간 인터랙티브 시각화와 최종 3D 포인트 클라우드 및 궤적의 정적 브라우저 기반 시각화를 모두 지원합니다.

대상 사용자

이 도구는 컴퓨터 비전, 로보틱스, 3D 장면 재구성 분야에서 일하는 연구자 및 개발자들을 위한 것으로, 공간 AI에 Transformer 기반 아키텍처를 활용하고자 하는 사람들을 대상으로 합니다.

주요 특징

  • 통합 아키텍처: SLAM 프로세스를 하나의 Transformer 모델에 통합합니다.
  • 효율적인 추론: 시퀀스 처리 중 메모리와 계산을 관리하기 위해 KV 프리닝을 지원합니다.
  • 유연한 시각화: 실시간 인터랙티브 3D 뷰와 정적 HTTP 기반 결과 시각화를 모두 제공합니다.
  • 다양한 학습 데이터: ARKitScenes, ScanNet, MegaDepth 등 여러 대규모 데이터셋에서 학습되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트