zhouhengamerica/XLens

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

解決的問題

X-Lens 解決了從多種不同相機類型(異質相機陣列)中估計深度的難題。傳統上,模型僅針對針孔(透視)或魚眼(廣視角)相機進行訓練,需要使用獨立的模型,或透過有損校正(將魚眼影像去畸變以模擬針孔影像)來協同工作。X-Lens 允許單一模型在一次前向傳播中處理任意組合的這些相機,恢復密集的度量深度和融合的3D點雲。

工作原理

X-Lens 採用交替幀到全域跨視圖注意力骨幹網路。它不進行影像校正,而是將每個像素表示為單位射線,並利用相機類型條件(校準標記和幾何畸變偏置)來處理不同的鏡頭模型。

關鍵技術組件包括:

  • 像素級射線表示:對魚眼相機使用查找表(LUT)將像素直接映射到視角方向。
  • 射線角度旋轉位置編碼(RoPE):幫助模型理解廣視角視圖的幾何結構。
  • 可學習的尺度頭:預測一個尺度因子,將相對深度轉換為絕對度量深度。
  • 點雲融合:將多個視角的深度圖統一投影到一個一致的世界座標系點雲中。

適用對象

本專案適用於從事3D場景重建、機器人和自主系統研究與開發的人員,他們使用包含標準鏡頭和廣角鏡頭的多相機陣列。

主要亮點

  • 統一模型:一個檢查點即可處理純針孔、純魚眼以及混合異質配置,無需重新訓練。
  • 原生魚眼支援:直接處理廣視角影像,避免去畸變帶來的品質損失。
  • 度量深度輸出:提供絕對距離測量值和置信度圖。
  • ONNX 導出:支援將相機幾何資訊嵌入圖中,透過 TensorRT 或 ONNX Runtime 實現高效能部署。
  • OmniScene 數據集:包含用於訓練和評估的6相機全景相機陣列的寫實合成數據集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案