Tsinghua-MARS-Lab/SLAM-Former
[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer
解決的問題
SLAM-Former 透過將整個同時定位與地圖建構(SLAM)流程整合至單一 Transformer 架構中,解決了 SLAM 的複雜性。旨在為從影像序列進行 3D 重構與相機追蹤提供簡化的方法。
工作原理
本專案實作一個基於 Transformer 的模型,用於處理影像序列以執行 SLAM。包含 KV 剪枝功能以優化推論,並採用 ConvHead 變體以減少輸出中的網格偽影。系統支援透過 Rerun 實現的即時互動式可視化,以及最終 3D 點雲與軌跡的靜態瀏覽器可視化。
適用對象
本工具專為從事電腦視覺、機器人學與 3D 場景重構的研究人員與開發者設計,適合希望利用 Transformer 架構進行空間 AI 的使用者。
主要亮點
- 統一架構:將 SLAM 流程整合至單一 Transformer 模型中。
- 高效推論:支援 KV 剪枝,以在序列處理過程中管理記憶體與運算。
- 彈性可視化:提供即時互動式 3D 檢視與基於 HTTP 的靜態結果可視化。
- 多樣訓練資料:在多個大型資料集(包括 ARKitScenes、ScanNet 和 MegaDepth)上進行訓練。
相關
- 專案
- 專案
- 專案
- 專案
- 專案