Robbyant/lingbot-map
A feed-forward 3D foundation model for reconstructing scenes from streaming data
해결하는 문제
LingBot-Map은 동영상 시퀀스에서 스트리밍 3D 재구성의 과제를 해결합니다. 전통적인 SLAM 또는 SfM 방법에서 일반적으로 요구되는 반복 최적화가 필요 없이 실시간(피드포워드)으로 밀도 높은 3D 포인트 클라우드와 카메라 궤적을 생성하며, 매우 긴 시퀀스(최대 25,000 프레임)에서도 안정성을 유지합니다.
작동 방식
이 프로젝트는 기하학적 컨텍스트 트랜스포머(Geometric Context Transformer)라는 피드포워드 3D 기초 모델을 사용합니다. 이 모델은 좌표 기준화, 고밀도 기하학적 단서, 장거리 드리프트 보정을 통합합니다. 효율적인 스트리밍 추론을 위해 FlashInfer 또는 SDPA를 통한 페이지화된 KV 캐시 어텐션 메커니즘을 활용합니다. 메모리 관리와 장거리 정확도 유지의 목적으로 키프레임 전략(매 N번째 프레임만 캐시)과 상태를 리셋하여 자세 붕괴를 방지하는 윈도우 기반 추론 모드를 사용합니다.
대상 사용자
3D 컴퓨터 비전, 로보틱스, 자율 항법 분야에서 일하는 연구자 및 개발자에게 적합합니다. 실내 및 실외 환경의 빠르고 스트리밍형 3D 재구성을 필요로 하는 사용자에게 최적입니다.
주요 특징
- 고효율 스트리밍: 518×378 해상도에서 약 20 FPS로 안정적인 추론이 가능합니다.
- 장시간 시퀀스 안정성: 윈도우 기반 추론과 궤적 메모리로 인해 13분 이상의 실내 탐색 시퀀스(예: 13분 실내 산책)를 지원합니다.
- 통합된 하늘 마스킹: ONNX 기반의 하늘 세그멘테이션 모델을 포함하여 하늘 점들을 필터링하여 더 깨끗한 실외 재구성을 제공합니다.
- 유연한 렌더링: Viser를 통해 제공되는 인터랙티브 브라우저 기반 뷰어와 고품질 플라이스루 비디오용 오프라인 배치 렌더링 파이프라인을 모두 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch