levyflux/AViD

Framework that enables fine-tuning of vision-language grounding models on custom datasets

解決的問題

AViD 為在自訂資料集上微調 Grounding DINO(一種開放式詞彙物件偵測器)提供實用的工作流程。它讓團隊能在不承擔更新每個模型參數的計算成本下,將大型偵測器適應至特定領域物件。

工作原理

AViD 使用 LoRA(低秩適應)實作參數高效微調(PEFT),針對偵測器的注意力、投影、FFN、邊界框與特徵圖層。為穩定訓練,還包含可選的指數移動平均(EMA)。系統使用基於 CSV 的資料集讀取器,並提供完整的流程,包含 YAML 驅動的訓練、檢查點,以及專用的評估迴圈,用於 mAP、精確度與召回率等指標。

適用對象

專為需要在特定物件上訓練視覺-語言偵測器,但又希望避免全參數微調的開發人員與 AI 團隊設計。

主要亮點

  • 參數高效適應:使用 LoRA 對特定層進行訓練,實現更快、更輕量的微調。
  • 端到端工作流程:在一個倉儲中整合資料集載入、訓練、驗證與評估。
  • 訓練穩定性:可選 EMA 支援,確保模型軌跡更平穩。
  • 偵測導向評估:提供詳細的分類別摘要與視覺化對比。
  • 靈活的入口點:包含 YAML 設定、Gradio 示範與單一影像推論腳本。

相關

  • 專案
  • 專案
  • 專案
  • 專案