levyflux/AViD

Framework that enables fine-tuning of vision-language grounding models on custom datasets

何を解決するか

AViDは、オープンボリュームオブジェクト検出器であるGrounding DINOをカスタムデータセット上で微調整するための実用的なワークフローを提供します。チームがすべてのモデルパラメータを更新する計算コストをかけずに、大規模な検出器をドメイン固有のオブジェクトに適応できるようにします。

仕組み

AViDは、LoRA(Low-Rank Adaptation)を用いたパラメータ効率的な微調整(PEFT)を実装し、検出器のアテンション、プロジェクション、FFN、バウンディングボックス、特徴マップ層をターゲットにします。訓練の安定化のために、オプションの指数移動平均(EMA)を含んでいます。システムはCSVベースのデータセットリーダーを使用し、YAML駆動のトレーニング、チェックポイント、およびmAP、精度、再現率などのメトリクスを評価する専用の評価ループを含む完全なパイプラインを提供します。

対象ユーザー

専門的なオブジェクト上でビジョン・ランゲージ検出器をトレーニングする必要があるが、全パラメータの微調整を避けたい開発者やAIチーム向けに設計されています。

特徴

  • パラメータ効率的な適応: 特定のレイヤーに特化したLoRAを使用し、高速で軽量なトレーニングを実現。
  • エンドツーエンドのワークフロー: データセット読み込み、トレーニング、検証、評価を1つのリポジトリで統合。
  • トレーニングの安定化: スムーズなモデル軌道を確保するためのオプションのEMAサポート。
  • 検出に特化した評価: クラスごとの詳細な要約と視覚的比較を提供。
  • 柔軟なエントリーポイント: YAML設定、Gradioデモ、単一画像推論スクリプトを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト