Tsinghua-MARS-Lab/SLAM-Former

[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer

何を解決するか

SLAM-Formerは、同時定位と地図作成(SLAM)の複雑さを、単一のTransformerアーキテクチャに統合することで解決します。画像シーケンスからの3D再構成とカメラトラッキングのための簡素化されたアプローチを提供することを目指しています。

動作方法

このプロジェクトは、画像シーケンスを処理してSLAMを実行するTransformerベースのモデルを実装しています。推論の最適化のためのKVプリーニングや、出力のグリッドアーティファクトを低減するConvHeadのバリエーションを含んでいます。システムは、Rerunを介したリアルタイムインタラクティブな可視化と、最終的な3Dポイントクラウドおよび軌道の静的ブラウザベースの可視化をサポートしています。

対象ユーザー

このツールは、コンピュータビジョン、ロボット工学、3Dシーン再構成に取り組む研究者や開発者向けに設計されており、空間AIにTransformerベースのアーキテクチャを活用したい人を対象としています。

主な特徴

  • 統合アーキテクチャ: SLAMプロセスを1つのTransformerモデルに統合しています。
  • 効率的な推論: シーケンス処理中のメモリと計算を管理するためにKVプリーニングをサポートしています。
  • 柔軟な可視化: リアルタイムインタラクティブな3D表示と静的HTTPベースの結果可視化の両方を提供しています。
  • 多様な学習データ: ARKitScenes、ScanNet、MegaDepthなど、複数の大規模データセットで訓練されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト