amap-cvlab/ABot-Recon

Streaming 3D reconstruction from only video input: Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

何を解決するか

ABot-Reconは、長時間のストリーミング3D再構成の課題に対処します。従来の手法は、長距離の状態やメモリを維持するために複雑なメカニズムに依存しており、シーケンス長が増えるにつれて計算コストが高くなる傾向があります。ABot-Reconは、局所的なコンテキストに焦点を当てることで、シーケンス長に関係なく効率的かつ一定のメモリ使用量を維持するシンプルなアプローチを採用しています。

動作方法

永続的な長距離メモリではなく、固定の12フレームの局所コンテキストウィンドウを使用します。各時刻ステップで以下の処理を行います:

  1. KVキャッシュ:直前の11フレームのKey-Value(KV)特徴をキャッシュします。
  2. 幾何予測:現在のカメラ座標系におけるポイントマップを予測します。
  3. ポーズ推定:現在フレームと直前のフレーム間の相対ポーズを推定します。
  4. グローバル合成:これらの相対ポーズを逐次的に合成することで、グローバルな軌道とポイントクラウドを回復します。

長時間にわたるシーケンスでのドリフトを最小限に抑えるために、軽量なモーション-ビジョナル回転リファイナーと、コンポジションに配慮したポーズ損失を採用しています。カメラが既知の領域を再訪した場合に、さらに軌道を精緻化するため、オプションのループクロージャーバックエンド(DINOv2-SALAD記述子を使用)を活用できます。

対象ユーザー

コンピュータビジョン、ロボティクス、3D再構成に取り組む研究者や開発者で、動画ストリームからマッピングや軌道推定を行う際に、メモリ効率が高くストリーミング対応可能なアプローチが必要な方々。

特徴

  • 一定のメモリフットプリント:1フレームあたりの計算とモデル状態メモリは、シーケンス長に依存しません。
  • 高い効率性:NVIDIA H100で最大24.45 FPSを達成。
  • 局所最優先アプローチ:12フレームの局所コンテキストウィンドウのみを使用して、長時間の動画ストリームを再構成。
  • オプションのループクロージャー:再訪領域に対して、スパースポーズグラフ最適化により軌道を精緻化する機能をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト