Robbyant/lingbot-map

A feed-forward 3D foundation model for reconstructing scenes from streaming data

何を解決するか

LingBot-Map は動画シーケンスからのストリーミング3D再構成の課題に対処します。従来のSLAMやSfM手法で一般的に必要な反復最適化を必要とせずに、リアルタイム(フィードフォワード)で高密度な3D点群とカメラ軌道を生成する方法を提供し、非常に長いシーケンス(最大25,000フレーム)においても安定性を維持します。

動作方法

本プロジェクトは、幾何的コンテキストトランスフォーマーと呼ばれるフィードフォワード3Dファウンデーションモデルを使用しています。このモデルは座標の基準化、高密度な幾何的ヒント、長距離ドリフト補正を統合しています。効率的なストリーミング推論のために、FlashInferまたはSDPAを介したページ化KVキャッシュアテンション機構を採用しています。メモリ管理と長距離での精度維持のため、キーフレーム戦略(Nフレームごとに1回のみキャッシュ)と、状態をリセットしてポーズ崩壊を防ぐウィンドウ化推論モードを用いています。

対象ユーザー

3Dコンピュータビジョン、ロボティクス、自律ナビゲーションに取り組む研究者や開発者向けに設計されています。屋内・屋外環境の高速かつストリーミング型3D再構成が必要な用途に最適です。

主な特徴

  • 高効率ストリーミング:518×378解像度で約20 FPSの安定した推論が可能。
  • 長時間シーケンスの安定性:ウィンドウ化推論と軌道メモリにより、13分間の屋内ウォークスルーなど極めて長いシーケンスをサポート。
  • 統合された空域マスク:ONNXベースの空域セグメンテーションモデルを内蔵し、屋外再構成の際の空の点群をフィルタリングしてクリーンな結果を実現。
  • 柔軟なレンダリング:Viserを介したインタラクティブなブラウザベースビューアと、高品質なフライスルー動画用のオフラインバッチレンダリングパイプラインを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch