levyflux/AViD
Framework that enables fine-tuning of vision-language grounding models on custom datasets
解决的问题
AViD 为在自定义数据集上微调 Grounding DINO(一种开放词汇对象检测器)提供了实用的工作流程。它使团队能够在不承担更新每个模型参数的计算成本的情况下,将大型检测器适配到特定领域对象。
工作原理
AViD 使用 LoRA(低秩适应)实现参数高效的微调(PEFT),针对检测器的注意力、投影、FFN、边界框和特征图层。为稳定训练,还包含可选的指数移动平均(EMA)。系统使用基于 CSV 的数据集读取器,并提供完整的流水线,包括 YAML 驱动的训练、检查点和专门用于 mAP、精度和召回率等指标的评估循环。
适用人群
专为需要在特定对象上训练视觉-语言检测器但又希望避免全参数微调的开发人员和 AI 团队设计。
主要亮点
- 参数高效适应:使用 LoRA 针对特定层进行训练,实现更快、更轻量的微调。
- 端到端工作流程:在一个仓库中集成数据集加载、训练、验证和评估。
- 训练稳定性:可选 EMA 支持,确保模型轨迹更平稳。
- 检测导向评估:提供详细的按类别汇总和可视化对比。
- 灵活的入口点:包含 YAML 配置、Gradio 演示和单图像推理脚本。
相关
- 项目
- 项目
- 项目
- 项目