hujiecpp/PE3R

[CVPR'26] PE3R: Perception-Efficient 3D Reconstruction. Take 2 - 3 photos with your phone, upload them, wait a few minutes, and then start exploring your 3D world via text!

解決的問題

PE3R 解決了建立既計算高效又具語義感知能力的 3D 場景重構的挑戰。它無需專用深度感測器,僅依賴 2D 圖像即可建構可透過語言理解的 3D 模型。

工作原理

該系統結合多種先進視覺模型以達成目標。它整合了 MASt3R 用於 3D 重構,SAM(Segment Anything Model)與 SAM 2 用於分割,以及 SigLIP 用於基於語言的語義理解,從而實現對不同場景與物件的零樣本泛化。

適用對象

本專案專為從事電腦視覺、3D 場景重構與具身 AI 的研究人員與開發者設計,他們需要一種快速、高效的方法,將 2D 圖像轉換為具語義標籤的 3D 環境。

核心亮點

  • 輸入高效性:僅使用 2D 圖像進行重構。
  • 時間高效性:加速 3D 語義重構過程。
  • 零樣本泛化:無需場景特定訓練,即可在各種場景與物件上通用。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案