Visionary-Laboratory/holi-spatial

[ICML 2026 Oral] Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

解決的問題

Holi-Spatial 旨在將原始影片串流轉換為全面的 3D 空間智能系統。它解決了從影片建立高品質、帶註釋的 3D 場景的挑戰,使模型能夠理解 3D 環境中的空間關係、物件實例與功能區域。

工作原理

本專案實現了一個多階段流水線,用於處理來自 ScanNet、ScanNet++ 與 DL3DV 等數據集的影片數據:

  1. 幾何優化:使用 Depth Anything 3 (DA3) 進行深度與點雲初始化,隨後透過 PGSR/3DGS 訓練建立 3D Gaussian Splatting 幾何形狀。
  2. 圖像級感知:利用 VLM (視覺語言模型) 發現物件類別與區域,並使用 SAM3 生成精確的圖像遮罩。
  3. 場景級提升與精煉:將 2D 遮罩提升至 3D 空間,合併並過濾 3D 邊界框,為實例生成描述,並合成空間問答 (QA) 對。

適用對象

致力於 3D 視覺、具身智能 (Embodied AI) 與多模態 LLM 的研究人員與開發人員,他們需要一個能夠為訓練視覺語言模型生成豐富註釋的 3D 空間數據集的流水線。

亮點

  • 端到端流水線:將影片串流轉換為 3DGS 幾何形狀、網格與 3D 邊界框註釋。
  • 大規模數據集生成:能夠生成數百萬個空間 QA 對(例如 HoliSpatial-QA-2M 數據集)。
  • 與基礎模型整合:利用 SAM3、Depth Anything 3 與 Qwen3-VL 進行感知與註釋。
  • SFT 就緒:包含將生成的 QA 數據轉換為與 LLaMA-Factory 相容格式以進行監督式微調 (SFT) 的工具。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案