amap-cvlab/ABot-Recon
Streaming 3D reconstruction from only video input: Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
解决的问题
ABot-Recon 解决了长时序流式 3D 重建的挑战。传统方法通常依赖复杂的机制来维持长距离状态或记忆,随着序列长度增加,计算成本会显著上升。ABot-Recon 通过聚焦局部上下文,简化了这一过程,无论序列长度如何,都能保持高效和恒定的内存使用量。
工作原理
系统不使用持久的长距离记忆,而是采用固定的 12 帧局部上下文窗口。在每个时间步中,执行以下操作:
- KV 缓存:缓存前 11 帧的 Key-Value (KV) 特征。
- 几何预测:在当前相机坐标系中预测点图。
- 位姿估计:估计当前帧与前一帧之间的相对位姿。
- 全局组合:通过逐次组合这些相对位姿,恢复全局轨迹和点云。
为减少长序列中的漂移,系统采用轻量级运动-视觉旋转校正器和面向组合的位姿损失。当相机重新访问已知区域时,可选的回环闭合后端(使用 DINOv2-SALAD 描述符)可用于进一步优化轨迹。
适用人群
从事计算机视觉、机器人和 3D 重建的研究人员和开发者,需要一种内存高效、支持流式处理的方案,从视频流中进行地图构建和轨迹估计。
主要亮点
- 恒定内存占用:每帧计算和模型状态内存与序列长度无关。
- 高效率:在 NVIDIA H100 上可达到最高 24.45 FPS。
- 局部优先方法:仅使用 12 帧局部上下文窗口即可重建长视频流。
- 可选回环闭合:支持通过稀疏位姿图优化对已访问区域进行轨迹精炼。
相关
- 项目
- 项目
- 项目
- 项目