facebookresearch/boxer

Code for the Boxer research paper

해결하는 문제

Boxer는 이미지에서의 2D 객체 탐지(경계 상자)를 개방형 환경에서 정확한 3D 방향 경계 상자(OBB)로 '끌어올리는' 문제를 해결합니다. 특히 실내 객체 탐지에 초점을 맞추어, 포즈된 이미지와 준밀도 점군만을 사용하여 3D 공간에서 객체를 식별할 수 있도록 합니다.

작동 방식

Boxer는 2D 탐지와 3D 추정을 결합한 파이프라인을 사용합니다. 사용자가 텍스트 프롬프트로 특정 객체를 요청할 수 있는 오픈 밸류 2D 탐지에 OWLv2를 활용하고, BoxerNet이라는 모델을 사용해 2D 상자를 3D로 변환합니다. 시스템은 단일 이미지 또는 동영상 시퀀스를 처리할 수 있으며, 카메라 내부 파라미터, 6자유도 포즈, 중력 방향을 활용하여 상자의 방향을 정확히 설정합니다. 또한 프레임 간 시간적 일관성을 유지하기 위한 온라인 3D 추적과, 여러 검출 결과를 하나의 글로벌 3D 표현으로 통합하는 오프라인 3D 융합도 지원합니다.

대상 사용자

컴퓨터 비전, 로보틱스, 실내 장면 이해 분야에서 일하는 연구자 및 개발자에게 적합합니다. 2D 이미지 탐지 결과를 공간적으로 정확한 3D 객체 위치와 방향으로 변환해야 하는 경우에 유용합니다.

주요 특징

  • 오픈 밸류 탐지: OWLv2를 통합하여 임의의 텍스트 프롬프트 기반 객체 탐지 가능.
  • 강력한 3D 변환: 2D 경계 상자를 3D 방향 경계 상자(OBB)로 변환.
  • 시간적 일관성: 온라인 트래커를 통해 동영상 프레임 간 객체 식별 유지.
  • 글로벌 융합: 후처리 융합을 통해 다수의 시점에서의 검출을 하나의 정적 글로벌 맵으로 통합.
  • 다양한 데이터셋 지원: Project Aria, CA-1M, SUN-RGBD, ScanNet 데이터와 호환.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트