Sompote/DINOV3-YOLOV12

Use DINOv3’s powerful, self-supervised visual features + YOLOv12’s blazing-fast detection, all in one repo. Whether you have only a few hundred labeled images or a medium-sized dataset, DINOV3-YOLOV12 helps you get better detection accuracy — without sacrificing speed. Great for niche domains, small-data projects, or quick prototyping.

解決的問題

本專案解決了在小規模或複雜資料集上實現資料高效物件檢測的挑戰,這些資料集上標準的基於CNN的檢測器(如YOLOv12)可能表現不佳。透過整合DINOv3的自監督視覺變壓器(ViT)特徵,該方法能在顯著減少訓練影像數量的情況下,實現更高的準確度(mAP)與更快的收斂速度。

工作原理

建構了一個混合架構,結合YOLOv12的速度優勢與DINOv3豐富的特徵提取能力。系統支援四種整合方式:

  • Single:使用DINOv3進行輸入預處理(P0)。
  • Dual:在P3與P4骨幹網路層級整合DINOv3。
  • Triple:結合P0輸入預處理與P3和P4骨幹網路增強。
  • DualP0P3:平衡方案,結合P0預處理與P3骨幹網路增強。

專案允許使用者將五種YOLOv12尺寸與官方DINOv3變體(如ViT-S、ViT-B、ViT-L)自由組合,創造超過40種不同的模型組態。

適用對象

  • AI研究人員與開發者:在標註資料有限的特定領域進行物件檢測工作的人員。
  • 自動駕駛工程師:需要在複雜場景(如KITTI資料集)中實現高精度檢測的人員。
  • 生產環境ML工程師:尋求推論速度與檢測準確度之間平衡的人員。

核心亮點

  • 顯著性能提升:在KITTI等複雜資料集上mAP提升高達88.6%,在小資料集上提升15-25%。
  • 資料高效性:將達到最佳性能所需的訓練輪數減少50-70%。
  • 靈活整合:支援Single、Dual、Triple、DualP0P3等多種整合層級,可靈活平衡顯存使用與準確度。
  • 精確狀態還原:具備穩健的訓練恢復系統,可完美還原全部61個超參數與損失值,避免訓練過程中的波動。
  • 自訂權重支援:支援載入本地的 .pth.pt.safetensors 格式的DINO權重檔案。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案