Tsinghua-MARS-Lab/SLAM-Former
[ECCV 2026] SLAM-Former: Putting SLAM into One Transformer
何を解決するか
SLAM-Formerは、同時定位と地図作成(SLAM)の複雑さを、単一のTransformerアーキテクチャに統合することで解決します。画像シーケンスからの3D再構成とカメラトラッキングのための簡素化されたアプローチを提供することを目指しています。
動作方法
このプロジェクトは、画像シーケンスを処理してSLAMを実行するTransformerベースのモデルを実装しています。推論の最適化のためのKVプリーニングや、出力のグリッドアーティファクトを低減するConvHeadのバリエーションを含んでいます。システムは、Rerunを介したリアルタイムインタラクティブな可視化と、最終的な3Dポイントクラウドおよび軌道の静的ブラウザベースの可視化をサポートしています。
対象ユーザー
このツールは、コンピュータビジョン、ロボット工学、3Dシーン再構成に取り組む研究者や開発者向けに設計されており、空間AIにTransformerベースのアーキテクチャを活用したい人を対象としています。
主な特徴
- 統合アーキテクチャ: SLAMプロセスを1つのTransformerモデルに統合しています。
- 効率的な推論: シーケンス処理中のメモリと計算を管理するためにKVプリーニングをサポートしています。
- 柔軟な可視化: リアルタイムインタラクティブな3D表示と静的HTTPベースの結果可視化の両方を提供しています。
- 多様な学習データ: ARKitScenes、ScanNet、MegaDepthなど、複数の大規模データセットで訓練されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト