amap-cvlab/ABot-Recon
Streaming 3D reconstruction from only video input: Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
解決的問題
ABot-Recon 解決了長時序串流式 3D 重建的挑戰。傳統方法通常依賴複雜的機制來維持長距離狀態或記憶,隨著序列長度增加,計算成本會顯著上升。ABot-Recon 透過聚焦局部上下文,簡化了此過程,無論序列長度如何,都能保持高效且恆定的記憶體使用量。
工作原理
系統不使用持久的長距離記憶,而是採用固定的 12 幀局部上下文視窗。在每個時間步中,執行以下操作:
- KV 快取:快取前 11 幀的 Key-Value (KV) 特徵。
- 幾何預測:在當前相機座標系中預測點圖。
- 位姿估計:估計當前幀與前一幀之間的相對位姿。
- 全域組合:透過逐次組合這些相對位姿,恢復全域軌跡和點雲。
為減少長序列中的漂移,系統採用輕量級運動-視覺旋轉校正器和面向組合的位姿損失。當相機重新訪問已知區域時,可選的迴圈閉合後端(使用 DINOv2-SALAD 描述符)可用於進一步優化軌跡。
適用對象
從事電腦視覺、機器人和 3D 重建的研究人員與開發者,需要一種記憶體高效、支援串流處理的方案,從影片串流中進行地圖建構與軌跡估計。
主要亮點
- 恆定記憶體佔用:每幀計算與模型狀態記憶體與序列長度無關。
- 高效率:在 NVIDIA H100 上可達最高 24.45 FPS。
- 局部優先方法:僅使用 12 幀局部上下文視窗即可重建長影片串流。
- 可選迴圈閉合:支援透過稀疏位姿圖最佳化對已訪問區域進行軌跡精煉。
相關
- 專案
- 專案
- 專案
- 專案