apple-aiml-research/ml-matrix3d

[CVPR 2025 Highlight] Matrix3D: Large Photogrammetry Model All-in-One

何を解決するか

Matrix3Dは、異なる3Dビジョンタスクを処理するために別々の専門モデルを必要としない、統合されたポトグラメトリーモデルを提供します。単一の画像や未撮影の画像からでも、ポーズ推定、深度予測、新視点合成を1つのフレームワーク内で実行できます。

動作方法

このシステムは、マスク推論を用いて異なるタスク間を動的に切り替えたり組み合わせたりする大規模なポトグラメトリーモデルを使用しています。モダリティフラグやビュー識別子を操作することで、単一画像や複数の撮影済み画像といったさまざまな入力状態を処理し、3D特性を予測できます。これらの出力は、修正された3Dガウススプラッティング(3DGS)パイプラインに供給され、完全な3D再構成を生成できます。

対象ユーザー

コンピュータビジョンおよび3D再構成に取り組む研究者や開発者向けです。限られた画像データからカメラポーズを推定したり、深度を予測したり、新しいビューを合成したりする柔軟な手段が必要な方々に最適です。

特徴

  • ワンストップアーキテクチャ: ポーズ推定、深度予測、新視点合成をすべて1つのモデルで処理。
  • 柔軟な入力: 単一ビューから3D再構成、未撮影の少数ショット3D再構成まで対応。
  • 3DGS統合: モデルの予測を3Dシーンに変換する修正された3Dガウススプラッティングパイプラインを含む。
  • マスク推論: 入力構成に応じて、ポトグラメトリーサブタスクを動的に組み合わせる機能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト