Robbyant/lingbot-map
A feed-forward 3D foundation model for reconstructing scenes from streaming data
解決的問題
LingBot-Map 解決了從影片序列進行即時 3D 重構的挑戰。它提供了一種方法,可在不需要傳統 SLAM 或 SfM 方法通常所需的反覆最佳化情況下,即時(前饋)生成密集的 3D 點雲與相機軌跡,同時在極長序列(最高達 25,000 幀)中保持穩定性。
工作原理
本專案使用一種 幾何上下文轉換器(Geometric Context Transformer),這是一種前饋式 3D 基礎模型,統一了座標定位、密集幾何線索與長距離漂移修正。它採用分頁 KV 快取注意力機制(透過 FlashInfer 或 SDPA 實作),以高效處理即時推論。為管理記憶體並維持長距離準確度,它使用關鍵幀策略(僅快取每 N 幀)與視窗化推論模式,透過重置狀態防止姿態崩潰。
適用對象
專為從事 3D 計算機視覺、機器人與自主導航的研究人員與開發者設計,適用於需要快速、即時重構室內與室外環境的場景。
主要亮點
- 高效率即時處理:在 518×378 解析度下,可達約 20 FPS 的穩定推論。
- 長序列穩定性:透過視窗化推論與軌跡記憶,支援極長序列(例如 13 分鐘的室內漫遊)。
- 整合天空遮罩:內建基於 ONNX 的天空分割模型,可過濾天空點,實現更乾淨的室外重構。
- 彈性渲染:提供透過 Viser 的瀏覽器互動式檢視器,以及用於高品質飛行影片的離線批次渲染流程。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch