Robbyant/lingbot-map
A feed-forward 3D foundation model for reconstructing scenes from streaming data
何を解決するか
LingBot-Map は動画シーケンスからのストリーミング3D再構成の課題に対処します。従来のSLAMやSfM手法で一般的に必要な反復最適化を必要とせずに、リアルタイム(フィードフォワード)で高密度な3D点群とカメラ軌道を生成する方法を提供し、非常に長いシーケンス(最大25,000フレーム)においても安定性を維持します。
動作方法
本プロジェクトは、幾何的コンテキストトランスフォーマーと呼ばれるフィードフォワード3Dファウンデーションモデルを使用しています。このモデルは座標の基準化、高密度な幾何的ヒント、長距離ドリフト補正を統合しています。効率的なストリーミング推論のために、FlashInferまたはSDPAを介したページ化KVキャッシュアテンション機構を採用しています。メモリ管理と長距離での精度維持のため、キーフレーム戦略(Nフレームごとに1回のみキャッシュ)と、状態をリセットしてポーズ崩壊を防ぐウィンドウ化推論モードを用いています。
対象ユーザー
3Dコンピュータビジョン、ロボティクス、自律ナビゲーションに取り組む研究者や開発者向けに設計されています。屋内・屋外環境の高速かつストリーミング型3D再構成が必要な用途に最適です。
主な特徴
- 高効率ストリーミング:518×378解像度で約20 FPSの安定した推論が可能。
- 長時間シーケンスの安定性:ウィンドウ化推論と軌道メモリにより、13分間の屋内ウォークスルーなど極めて長いシーケンスをサポート。
- 統合された空域マスク:ONNXベースの空域セグメンテーションモデルを内蔵し、屋外再構成の際の空の点群をフィルタリングしてクリーンな結果を実現。
- 柔軟なレンダリング:Viserを介したインタラクティブなブラウザベースビューアと、高品質なフライスルー動画用のオフラインバッチレンダリングパイプラインを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch