levyflux/AViD

Framework that enables fine-tuning of vision-language grounding models on custom datasets

解决的问题

AViD 为在自定义数据集上微调 Grounding DINO(一种开放词汇对象检测器)提供了实用的工作流程。它使团队能够在不承担更新每个模型参数的计算成本的情况下,将大型检测器适配到特定领域对象。

工作原理

AViD 使用 LoRA(低秩适应)实现参数高效的微调(PEFT),针对检测器的注意力、投影、FFN、边界框和特征图层。为稳定训练,还包含可选的指数移动平均(EMA)。系统使用基于 CSV 的数据集读取器,并提供完整的流水线,包括 YAML 驱动的训练、检查点和专门用于 mAP、精度和召回率等指标的评估循环。

适用人群

专为需要在特定对象上训练视觉-语言检测器但又希望避免全参数微调的开发人员和 AI 团队设计。

主要亮点

  • 参数高效适应:使用 LoRA 针对特定层进行训练,实现更快、更轻量的微调。
  • 端到端工作流程:在一个仓库中集成数据集加载、训练、验证和评估。
  • 训练稳定性:可选 EMA 支持,确保模型轨迹更平稳。
  • 检测导向评估:提供详细的按类别汇总和可视化对比。
  • 灵活的入口点:包含 YAML 配置、Gradio 演示和单图像推理脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目