zhouhengamerica/XLens
X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
何を解決するか
X-Lensは、異なるカメラタイプ(異種のカメラセット)からの深度推定の難しさに対処します。従来、モデルはピンホール(透視)カメラまたはフィッシュアイ(広視野)カメラのいずれかに特化して訓練されており、両者を統合するには別々のモデルが必要、またはフィッシュアイ画像をピンホール風に歪み補正(undistort)する必要がありました。X-Lensは、1つのモデルで任意の組み合わせのカメラを1回の順伝播で処理し、密なメトリック深度と統合された3D点群を回復できます。
動作方法
X-Lensは、フレーム間からグローバルなクロスビュー注意機構を交互に使用するバックボーンを採用しています。画像の歪み補正を行わず、各ピクセルをユニットレイとして表現し、カメラタイプの条件(キャリブレーショントークンと幾何学的歪みバイアス)を用いて異なるレンズモデルに対応します。
主な技術的要素は以下の通りです:
- ピクセルごとのレイ表現:フィッシュアイカメラ用にLook-Up Table(LUT)を使用し、ピクセルを視線方向に直接マッピングします。
- レイ角度用ロータリ位置符号化(RoPE):広視野ビューの幾何学的構造をモデルが理解できるように支援します。
- 学習可能なスケールヘッド:相対深度を絶対的なメトリック深度に変換するスケール係数を予測します。
- 点群統合:複数視点からの深度マップを1つの一貫した世界座標系の点群に再投影します。
対象ユーザー
3Dシーン再構築、ロボット工学、自律システムに取り組む研究者や開発者で、標準レンズと広角レンズを組み合わせたマルチカメラセットを使用している方々です。
特徴
- 統一モデル:再訓練なしで純粋なピンホール、純粋なフィッシュアイ、および混合異種構成をすべて1つのチェックポイントで処理可能。
- ネイティブなフィッシュアイ対応:歪み補正なしで広視野画像を直接処理し、補正による品質低下を回避。
- メトリック深度出力:絶対距離測定値と信頼度マップを提供。
- ONNXエクスポート:カメラ幾何学をグラフに埋め込み、TensorRTやONNX Runtimeによる高性能デプロイを可能に。
- OmniSceneデータセット:訓練・評価用に、6カメラのオムニディレクショナルカメラセットを含む写実的な合成データセット。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト