OschAI/VisioFirm

VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision

解決的問題

VisioFirm 是一款基於 AI 的影像與影片標註工具,可大幅減少電腦視覺資料集標註所需的手動工作量。它透過提供多種任務的半自動預標註,消除從零開始標註的需要,顯著加速研究人員與機器學習工程師的工作流程。

工作原理

該工具提供一個瀏覽器為基礎的互動式畫布,使用者可在其中微調 AI 生成的標籤。它整合多種先進模型,以自動化初始標註階段:

  • 檢測與定位:使用 YOLO(v5-v12)、Grounding DINO(透過文字提示實現零樣本檢測)以及 YOLOv8-world 實現開放詞彙預標註。
  • 分割:採用 SAM2 實現精確分割與點擊分割功能。
  • 分類:使用 OpenAI CLIP 提供影像類別建議。
  • 影片追蹤:"SmartPropagator" 使用 SAM2 在畫格之間傳播標籤,其他選項包括 OpenCV 跟蹤器與線性插值。
  • 跨領域工作流程:使用者可從檢測模型生成分割遮罩,或從分割模型生成邊界框。

適用對象

專為需要建立高品質標註資料集以訓練電腦視覺模型(如 YOLO 或 SAM)的研究人員、資料科學家與機器學習工程師設計。

主要亮點

  • 多任務支援:支援分類、軸對齊邊界框、方向性邊界框(OBB)與多邊形分割。
  • AI 驅動的高效性:利用 SAM2、YOLO 與 Grounding DINO,可節省高達 80% 的手動工作量。
  • 影片標註功能:支援使用 SAM2 與多種 OpenCV 跟蹤器實現畫格間標籤傳播。
  • 彈性匯出:支援以 YOLO、COCO 與自訂格式匯出標註結果。
  • 整合能力:提供 Python API 用於流程整合,並支援雲端/SSH 圖像下載。

相關

  • 專案
  • 專案
  • 專案
  • 專案