hujiecpp/PE3R

[CVPR'26] PE3R: Perception-Efficient 3D Reconstruction. Take 2 - 3 photos with your phone, upload them, wait a few minutes, and then start exploring your 3D world via text!

何を解決するか

PE3Rは、計算効率と意味的理解を両立した3D再構成を実現するシステムです。専用の深度センサーを必要とせず、2D画像のみで言語で理解可能な3Dモデルを構築します。

動作方法

このシステムは、高度な視覚モデルの組み合わせを活用しています。MASt3Rによる3D再構成、SAM(Segment Anything Model)およびSAM 2によるセグメンテーション、SigLIPによる言語ベースの意味理解を統合することで、異なるシーンやオブジェクトに対してゼロショット一般化を実現します。

対象ユーザー

コンピュータビジョン、3Dシーン再構成、エンベデッドAIに取り組む研究者や開発者向けです。2D画像から意味ラベル付きの3D環境を迅速かつ効率的に生成したい方におすすめです。

特徴

  • 入力効率: 再構成に2D画像のみを使用。
  • 時間効率: 3D意味再構成のプロセスを高速化。
  • ゼロショット一般化: シーン固有の学習なしで、さまざまなシーンやオブジェクトに対応可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト