Visionary-Laboratory/holi-spatial
[ICML 2026 Oral] Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
解決的問題
Holi-Spatial 旨在將原始影片串流轉換為全面的 3D 空間智能系統。它解決了從影片建立高品質、帶註釋的 3D 場景的挑戰,使模型能夠理解 3D 環境中的空間關係、物件實例與功能區域。
工作原理
本專案實現了一個多階段流水線,用於處理來自 ScanNet、ScanNet++ 與 DL3DV 等數據集的影片數據:
- 幾何優化:使用 Depth Anything 3 (DA3) 進行深度與點雲初始化,隨後透過 PGSR/3DGS 訓練建立 3D Gaussian Splatting 幾何形狀。
- 圖像級感知:利用 VLM (視覺語言模型) 發現物件類別與區域,並使用 SAM3 生成精確的圖像遮罩。
- 場景級提升與精煉:將 2D 遮罩提升至 3D 空間,合併並過濾 3D 邊界框,為實例生成描述,並合成空間問答 (QA) 對。
適用對象
致力於 3D 視覺、具身智能 (Embodied AI) 與多模態 LLM 的研究人員與開發人員,他們需要一個能夠為訓練視覺語言模型生成豐富註釋的 3D 空間數據集的流水線。
亮點
- 端到端流水線:將影片串流轉換為 3DGS 幾何形狀、網格與 3D 邊界框註釋。
- 大規模數據集生成:能夠生成數百萬個空間 QA 對(例如 HoliSpatial-QA-2M 數據集)。
- 與基礎模型整合:利用 SAM3、Depth Anything 3 與 Qwen3-VL 進行感知與註釋。
- SFT 就緒:包含將生成的 QA 數據轉換為與 LLaMA-Factory 相容格式以進行監督式微調 (SFT) 的工具。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案