hujiecpp/PE3R

[CVPR'26] PE3R: Perception-Efficient 3D Reconstruction. Take 2 - 3 photos with your phone, upload them, wait a few minutes, and then start exploring your 3D world via text!

解决的问题

PE3R 解决了创建既计算高效又具备语义感知能力的 3D 场景重建的挑战。它无需专用深度传感器,仅依赖 2D 图像即可构建可通过语言理解的 3D 模型。

工作原理

该系统结合了多种先进视觉模型以实现其目标。它整合了 MASt3R 用于 3D 重建,SAM(Segment Anything Model)和 SAM 2 用于分割,以及 SigLIP 用于基于语言的语义理解,从而实现对不同场景和物体的零样本泛化。

适用人群

本项目专为从事计算机视觉、3D 场景重建和具身 AI 的研究人员和开发者设计,他们需要一种快速、高效的方法,将 2D 图像转换为带有语义标签的 3D 环境。

核心亮点

  • 输入高效性:仅使用 2D 图像进行重建。
  • 时间高效性:加速 3D 语义重建过程。
  • 零样本泛化:无需场景特定训练,即可在各种场景和物体上通用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目