Visionary-Laboratory/holi-spatial

[ICML 2026 Oral] Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

解決する課題

Holi-Spatialは、生のビデオストリームを包括的な3D空間インテリジェンスシステムに変換するために設計されています。ビデオから高品質でアノテーションされた3Dシーンを作成するという課題に対処し、モデルが3D環境内の空間的関係、オブジェクトインスタンス、および機能領域を理解できるようにします。

仕組み

このプロジェクトは、ScanNet、ScanNet++、DL3DVなどのデータセットからのビデオデータを処理するために、多段階のパイプラインを実装しています:

  1. 幾何学的最適化: Depth Anything 3 (DA3) を使用して深度とポイントクラウドの初期化を行い、その後に PGSR/3DGS トレーニングを実行して 3D Gaussian Splatting ジオメトリを作成します。
  2. イメージレベルの知覚: VLM (Vision-Language Models) を使用してオブジェクトのクラスと領域を特定し、SAM3 を使用して正確なイメージマスクを生成します。
  3. シーンレベルのリフトと洗練: 2D マスクを3D空間にリフトし、3D バウンディングボックスをマージおよびフィルタリングし、インスタンスのキャプションを生成し、空間的な質疑応答 (QA) ペアを合成します。

対象者

3Dビジョン、エンボディドAI、およびマルチモーダルLLMに取り組んでおり、視覚言語モデルのトレーニング用に豊富にアノテーションされた3D空間データセットを生成するパイプラインを必要とする研究者や開発者。

ハイライト

  • エンドツーエンドのパイプライン: ビデオストリームを3DGS ジオメトリ、メッシュ、および3D バウンディングボックスのアノテーションに変換します。
  • 大規模データセット生成: 数百万の空間QAペア(例:HoliSpatial-QA-2M データセット)を生成可能です。
  • 基盤モデルとの統合: 知覚とアノテーションに SAM3、Depth Anything 3、および Qwen3-VL を活用します。
  • SFT 対応: 生成されたQAデータを、教師あり微調整 (SFT) 用に LLaMA-Factory と互換性のある形式に変換するツールが含まれています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト