Robbyant/lingbot-map
A feed-forward 3D foundation model for reconstructing scenes from streaming data
解决的问题
LingBot-Map 解决了从视频序列进行流式 3D 重建的挑战。它提供了一种无需传统 SLAM 或 SfM 方法通常所需的迭代优化,即可实时(前馈)生成密集 3D 点云和相机轨迹的方法,同时在极长序列(长达 25,000 帧)中保持稳定性。
工作原理
该项目使用一种 几何上下文变换器(Geometric Context Transformer),这是一种前馈式 3D 基础模型,统一了坐标定位、密集几何线索和长距离漂移校正。它采用分页 KV 缓存注意力机制(通过 FlashInfer 或 SDPA 实现),以高效处理流式推理。为管理内存并保持长距离精度,它使用关键帧策略(仅缓存每 N 帧)和窗口化推理模式,通过重置状态防止姿态崩溃。
适用人群
专为从事 3D 计算机视觉、机器人和自主导航的研究人员和开发者设计,适用于需要快速、流式重建室内和室外环境的场景。
主要亮点
- 高效率流式处理:在 518×378 分辨率下,可实现约 20 FPS 的稳定推理。
- 长序列稳定性:通过窗口化推理和轨迹记忆,支持极长序列(例如 13 分钟的室内漫游)。
- 集成天空掩码:内置基于 ONNX 的天空分割模型,可过滤天空点,实现更干净的室外重建。
- 灵活渲染:提供基于浏览器的交互式查看器(通过 Viser)和用于高质量飞行视频的离线批量渲染管道。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch