zhouhengamerica/XLens
X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
해결하는 문제
X-Lens는 다양한 카메라 유형(이종 카메라 레이아웃)에서 깊이를 추정하는 어려움을 해결합니다. 기존에는 핀홀(투시) 또는 필시아(광시야) 카메라 중 하나에 특화된 모델이 개발되었으며, 둘을 함께 사용하려면 별도의 모델이 필요하거나, 필시아 이미지를 핀홀처럼 보이게 왜곡 보정(undistort)해야 했습니다. X-Lens는 하나의 모델로 어떤 조합의 카메라든 한 번의 순전파로 처리하여 밀도 높은 메트릭 깊이와 통합된 3D 포인트 클라우드를 복원할 수 있습니다.
작동 방식
X-Lens는 프레임 간-글로벌 크로스뷰 어텐션 백본을 교차적으로 사용합니다. 이미지 왜곡 보정을 하지 않고, 각 픽셀을 유닛 레이로 표현하고, 카메라 유형 조건(캘리브레이션 토큰 및 기하학적 왜곡 바이어스)을 활용해 다양한 렌즈 모델을 처리합니다.
핵심 기술 요소는 다음과 같습니다:
- 픽셀 단위 레이 표현: 필시아 카메라용 Look-Up Table (LUT)을 사용해 픽셀을 시야 방향으로 직접 매핑합니다.
- 레이 각도 회전 위치 인코딩 (RoPE): 광시야 뷰의 기하학적 구조를 모델이 이해할 수 있도록 도와줍니다.
- 학습 가능한 스케일 헤드: 상대 깊이를 절대 메트릭 깊이로 변환하는 스케일 인자를 예측합니다.
- 포인트 클라우드 융합: 여러 시점의 깊이 맵을 하나의 일관된 월드 프레임 포인트 클라우드로 재투영합니다.
대상 사용자
다중 카메라 레이아웃(일반 렌즈와 광각 렌즈를 혼합)을 사용하는 3D 장면 재구성, 로봇공학, 자율 시스템 분야의 연구자 및 개발자입니다.
주요 특징
- 통합 모델: 재학습 없이 순수 핀홀, 순수 필시아, 혼합 이종 설정을 모두 하나의 체크포인트로 처리 가능.
- 네이티브 필시아 지원: 왜곡 보정 없이 광시야 이미지를 직접 처리해 보정 과정에서 발생하는 품질 저하를 방지.
- 메트릭 깊이 출력: 절대 거리 측정값과 신뢰도 맵을 제공.
- ONNX 내보내기: 카메라 기하학을 그래프에 고정하여 TensorRT 또는 ONNX Runtime을 통한 고성능 배포 지원.
- OmniScene 데이터셋: 학습 및 평가용으로 6카메라 오미디렉셔널 레이아웃을 포함한 실사 수준의 합성 데이터셋.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트