Tsinghua-MARS-Lab/SLAM-Former
[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer
解决的问题
SLAM-Former 通过将整个同时定位与建图(SLAM)过程统一到一个 Transformer 架构中,解决了 SLAM 的复杂性。旨在为从图像序列中进行 3D 重建和相机跟踪提供一种简化的方案。
工作原理
该项目实现了一个基于 Transformer 的模型,用于处理图像序列以执行 SLAM。包含 KV 剪枝功能以优化推理,并采用 ConvHead 变体以减少输出中的网格伪影。系统支持通过 Rerun 实现的实时交互式可视化,以及最终 3D 点云和轨迹的静态浏览器可视化。
适用人群
本工具专为从事计算机视觉、机器人学和 3D 场景重建的研究人员和开发者设计,适合希望利用 Transformer 架构进行空间 AI 的用户。
主要亮点
- 统一架构:将 SLAM 过程整合到一个 Transformer 模型中。
- 高效推理:支持 KV 剪枝,以在序列处理过程中管理内存和计算。
- 灵活可视化:提供实时交互式 3D 查看和基于 HTTP 的静态结果可视化。
- 多样训练数据:在多个大规模数据集(包括 ARKitScenes、ScanNet 和 MegaDepth)上进行训练。
相关
- 项目
- 项目
- 项目
- 项目
- 项目