zhouhengamerica/XLens

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

解决的问题

X-Lens 解决了从多种不同相机类型(异构相机阵列)中估计深度的难题。传统上,模型仅针对针孔(透视)或鱼眼(广视角)相机进行训练,需要使用独立的模型,或通过有损校正(将鱼眼图像去畸变以模拟针孔图像)来协同工作。X-Lens 允许单个模型在一次前向传播中处理任意组合的这些相机,恢复密集的度量深度和融合的3D点云。

工作原理

X-Lens 采用交替帧到全局跨视图注意力骨干网络。它不进行图像校正,而是将每个像素表示为单位射线,并利用相机类型条件(校准标记和几何畸变偏置)来处理不同的镜头模型。

关键技术组件包括:

  • 像素级射线表示:对鱼眼相机使用查找表(LUT)将像素直接映射到视角方向。
  • 射线角度旋转位置编码(RoPE):帮助模型理解广视角视图的几何结构。
  • 可学习的尺度头:预测一个尺度因子,将相对深度转换为绝对度量深度。
  • 点云融合:将多个视角的深度图统一投影到一个一致的世界坐标系点云中。

适用人群

本项目适用于从事3D场景重建、机器人和自主系统研究与开发的人员,他们使用包含标准镜头和广角镜头的多相机阵列。

主要亮点

  • 统一模型:一个检查点即可处理纯针孔、纯鱼眼以及混合异构配置,无需重新训练。
  • 原生鱼眼支持:直接处理广视角图像,避免去畸变带来的质量损失。
  • 度量深度输出:提供绝对距离测量值和置信度图。
  • ONNX 导出:支持将相机几何信息嵌入图中,通过 TensorRT 或 ONNX Runtime 实现高性能部署。
  • OmniScene 数据集:包含用于训练和评估的6相机全景相机阵列的写实合成数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目