OschAI/VisioFirm

VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision

何を解決するか

VisioFirm は、コンピュータビジョン用データセットのラベル付けに必要な手作業を削減する、AI駆動の画像・動画アノテーションツールです。完全にゼロからラベルを付ける必要がなく、さまざまなタスクに対して半自動的な事前ラベル付けを提供することで、研究者やMLエンジニアの作業を大幅に高速化します。

動作方法

このツールは、ブラウザベースのインタラクティブキャンバスを提供し、ユーザーがAI生成ラベルを微調整できます。最先端の複数のモデルを統合して、初期ラベル付けフェーズを自動化します:

  • 検出とグランドイング:YOLO(v5-v12)、Grounding DINO(テキストプロンプトによるゼロショット検出用)、YOLOv8-world(オープンボリューム事前ラベル付け用)を使用。
  • セグメンテーション:SAM2 を使用して高精度なセグメンテーションとクリックによるセグメンテーションを実現。
  • 分類:OpenAI CLIP を使用して画像のクラスを提案。
  • 動画トラッキング:"SmartPropagator" は SAM2 を使ってフレーム間でラベルを伝搬し、他のオプションとして OpenCV トラックャーや線形補間も利用可能。
  • クロスドメインワークフロー:検出モデルからセグメンテーションマスクを生成したり、セグメンテーションモデルからバウンディングボックスを生成したりできます。

対象ユーザー

YOLO や SAM などのコンピュータビジョンモデルの学習に使用する高品質なアノテーションデータセットを作成する必要がある研究者、データサイエンティスト、MLエンジニア向けに設計されています。

主な特徴

  • マルチタスク対応:分類、軸平行バウンディングボックス、回転バウンディングボックス(OBB)、ポリゴンセグメンテーションを対応。
  • AI駆動の高速化:SAM2、YOLO、Grounding DINO を活用し、手作業の80%を削減可能。
  • 動画アノテーション:SAM2 と複数の OpenCV トラックャーを用いたフレーム間ラベル伝搬機能。
  • 柔軟なエクスポート:YOLO、COCO、カスタムフォーマットでのアノテーションエクスポートに対応。
  • 統合機能:Python API を備え、パイプライン統合が可能。クラウド/SSH からの画像ダウンロードもサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト