hujiecpp/PE3R

[CVPR'26] PE3R: Perception-Efficient 3D Reconstruction. Take 2 - 3 photos with your phone, upload them, wait a few minutes, and then start exploring your 3D world via text!

해결하는 문제

PE3R은 계산 효율적이고 의미 인식이 가능한 3D 재구성 시스템을 제공합니다. 전용 깊이 센서가 필요 없으며, 단지 2D 이미지만으로 언어로 이해할 수 있는 3D 모델을 생성합니다.

작동 방식

이 시스템은 고급 비전 모델의 조합을 활용하여 목표를 달성합니다. MASt3R을 통한 3D 재구성, SAM(Segment Anything Model)과 SAM 2를 통한 세그멘테이션, 그리고 SigLIP을 통한 언어 기반 의미 이해를 통합하여 다양한 장면과 객체에 대해 제로샷 일반화를 가능하게 합니다.

대상 사용자

컴퓨터 비전, 3D 장면 재구성, 몸체 기반 AI 분야에서 연구 및 개발을 수행하는 연구자와 개발자에게 적합합니다. 2D 이미지를 의미 있는 레이블이 부여된 3D 환경으로 빠르고 효율적으로 변환할 필요가 있는 분들께 추천합니다.

주요 특징

  • 입력 효율성: 재구성에 2D 이미지만 사용.
  • 시간 효율성: 3D 의미 재구성 프로세스를 가속화.
  • 제로샷 일반화: 장면별 특화 학습 없이 다양한 장면과 객체에 적용 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트