Tsinghua-MARS-Lab/SLAM-Former

[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer

解决的问题

SLAM-Former 通过将整个同时定位与建图(SLAM)过程统一到一个 Transformer 架构中,解决了 SLAM 的复杂性。旨在为从图像序列中进行 3D 重建和相机跟踪提供一种简化的方案。

工作原理

该项目实现了一个基于 Transformer 的模型,用于处理图像序列以执行 SLAM。包含 KV 剪枝功能以优化推理,并采用 ConvHead 变体以减少输出中的网格伪影。系统支持通过 Rerun 实现的实时交互式可视化,以及最终 3D 点云和轨迹的静态浏览器可视化。

适用人群

本工具专为从事计算机视觉、机器人学和 3D 场景重建的研究人员和开发者设计,适合希望利用 Transformer 架构进行空间 AI 的用户。

主要亮点

  • 统一架构:将 SLAM 过程整合到一个 Transformer 模型中。
  • 高效推理:支持 KV 剪枝,以在序列处理过程中管理内存和计算。
  • 灵活可视化:提供实时交互式 3D 查看和基于 HTTP 的静态结果可视化。
  • 多样训练数据:在多个大规模数据集(包括 ARKitScenes、ScanNet 和 MegaDepth)上进行训练。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目