amap-cvlab/ABot-Recon

Streaming 3D reconstruction from only video input: Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

解决的问题

ABot-Recon 解决了长时序流式 3D 重建的挑战。传统方法通常依赖复杂的机制来维持长距离状态或记忆,随着序列长度增加,计算成本会显著上升。ABot-Recon 通过聚焦局部上下文,简化了这一过程,无论序列长度如何,都能保持高效和恒定的内存使用量。

工作原理

系统不使用持久的长距离记忆,而是采用固定的 12 帧局部上下文窗口。在每个时间步中,执行以下操作:

  1. KV 缓存:缓存前 11 帧的 Key-Value (KV) 特征。
  2. 几何预测:在当前相机坐标系中预测点图。
  3. 位姿估计:估计当前帧与前一帧之间的相对位姿。
  4. 全局组合:通过逐次组合这些相对位姿,恢复全局轨迹和点云。

为减少长序列中的漂移,系统采用轻量级运动-视觉旋转校正器和面向组合的位姿损失。当相机重新访问已知区域时,可选的回环闭合后端(使用 DINOv2-SALAD 描述符)可用于进一步优化轨迹。

适用人群

从事计算机视觉、机器人和 3D 重建的研究人员和开发者,需要一种内存高效、支持流式处理的方案,从视频流中进行地图构建和轨迹估计。

主要亮点

  • 恒定内存占用:每帧计算和模型状态内存与序列长度无关。
  • 高效率:在 NVIDIA H100 上可达到最高 24.45 FPS。
  • 局部优先方法:仅使用 12 帧局部上下文窗口即可重建长视频流。
  • 可选回环闭合:支持通过稀疏位姿图优化对已访问区域进行轨迹精炼。

相关

  • 项目
  • 项目
  • 项目
  • 项目