levyflux/AViD
Framework that enables fine-tuning of vision-language grounding models on custom datasets
解決的問題
AViD 為在自訂資料集上微調 Grounding DINO(一種開放式詞彙物件偵測器)提供實用的工作流程。它讓團隊能在不承擔更新每個模型參數的計算成本下,將大型偵測器適應至特定領域物件。
工作原理
AViD 使用 LoRA(低秩適應)實作參數高效微調(PEFT),針對偵測器的注意力、投影、FFN、邊界框與特徵圖層。為穩定訓練,還包含可選的指數移動平均(EMA)。系統使用基於 CSV 的資料集讀取器,並提供完整的流程,包含 YAML 驅動的訓練、檢查點,以及專用的評估迴圈,用於 mAP、精確度與召回率等指標。
適用對象
專為需要在特定物件上訓練視覺-語言偵測器,但又希望避免全參數微調的開發人員與 AI 團隊設計。
主要亮點
- 參數高效適應:使用 LoRA 對特定層進行訓練,實現更快、更輕量的微調。
- 端到端工作流程:在一個倉儲中整合資料集載入、訓練、驗證與評估。
- 訓練穩定性:可選 EMA 支援,確保模型軌跡更平穩。
- 偵測導向評估:提供詳細的分類別摘要與視覺化對比。
- 靈活的入口點:包含 YAML 設定、Gradio 示範與單一影像推論腳本。
相關
- 專案
- 專案
- 專案
- 專案