remyxai/VQASynth

Compose multimodal datasets 🎹

解決的問題

VQASynth 是為了解決 AI 預訓練資料集中高品質空間推理資料稀缺的問題而設計。它讓使用者能將標準影像資料集轉換為專注於 3D 空間關係、距離與方向的視覺問答(VQA)資料集,這對於具身 AI 與機器人技術至關重要。

工作原理

本專案實作一個融合語意與度量資料的合成空間 VQA 對生成流程。流程包含:

  1. 定位:使用 Florence-2 和 SAM2 等工具偵測並分割與任務相關的物件。
  2. 3D 重構:利用 VGGT 將影像提升至 3D,產生每個物件的點雲、深度圖與內參數。
  3. VQA 生成:使用提示產生器根據重構的 3D 場景生成問題-答案對,通常結合鏈式思考(CoT)推理以提升準確性。

此外,專案亦提供基於代理的方法(透過 NOOA),可動態組合工具呼叫(例如:度量深度、物件方向、區域描述),無需遵循預設模板即可即時回答空間問題。

適用對象

  • AI 研究人員:從事視覺-語言模型(VLM)與空間推理的研究者。
  • 機器人開發者:需要理解物理環境中 3D 距離與物件方向的具身 AI 開發工程師。
  • 資料集策展人:希望為既有影像資料集添加具體空間註解的使用者。

主要亮點

  • 度量深度整合:以 VGGT 取代 DepthPro,實現更快、更精確的度量深度估計。
  • 合成資料生成:可產生 SpaceOm 與 SpaceThinker 等資料集,用於 VLM 的指令微調。
  • 動態工具組合:代理版本支援透過多種工具(例如:Orient-Anything、MediaPipe 姿態關鍵點)靈活、非模板化地進行空間推理。
  • CoT 推理:生成推理路徑,使 VLM 能根據現實世界物件先驗與視覺線索估算距離。
  • Lerobot 整合:相容 VlmClient 協定,可在機器人學習流程中作為獎勵或 CoT 來源使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案