Sompote/DINOV3-YOLOV12

Use DINOv3’s powerful, self-supervised visual features + YOLOv12’s blazing-fast detection, all in one repo. Whether you have only a few hundred labeled images or a medium-sized dataset, DINOV3-YOLOV12 helps you get better detection accuracy — without sacrificing speed. Great for niche domains, small-data projects, or quick prototyping.

解决的问题

本项目解决了在小规模或复杂数据集上实现数据高效物体检测的挑战,这些数据集上标准的基于CNN的检测器(如YOLOv12)可能表现不佳。通过整合DINOv3的自监督视觉Transformer(ViT)特征,该方法能够在显著减少训练图像数量的情况下实现更高的精度(mAP)和更快的收敛速度。

工作原理

构建了一个混合架构,结合了YOLOv12的速度优势与DINOv3丰富的特征提取能力。系统支持四种集成方式:

  • Single:使用DINOv3进行输入预处理(P0)。
  • Dual:在P3和P4骨干网络层级集成DINOv3。
  • Triple:结合P0输入预处理与P3和P4骨干网络增强。
  • DualP0P3:平衡方案,结合P0预处理与P3骨干网络增强。

项目允许用户将五种YOLOv12尺寸与官方DINOv3变体(如ViT-S、ViT-B、ViT-L)自由组合,创建超过40种不同的模型配置。

适用人群

  • AI研究人员和开发者:在标注数据有限的特定领域进行物体检测工作的人员。
  • 自动驾驶工程师:需要在复杂场景(如KITTI数据集)中实现高精度检测的人员。
  • 生产环境ML工程师:寻求推理速度与检测精度之间平衡的人员。

核心亮点

  • 显著性能提升:在KITTI等复杂数据集上mAP提升高达88.6%,在小数据集上提升15-25%。
  • 数据高效性:将达到最优性能所需的训练轮数减少50-70%。
  • 灵活集成:支持Single、Dual、Triple、DualP0P3等多种集成层级,可灵活平衡显存占用与精度。
  • 精确状态恢复:具备稳健的训练恢复系统,可完美还原全部61个超参数和损失值,避免训练过程中的波动。
  • 自定义权重支持:支持加载本地的 .pth.pt.safetensors 格式的DINO权重文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目