Sompote/DINOV3-YOLOV12
Use DINOv3’s powerful, self-supervised visual features + YOLOv12’s blazing-fast detection, all in one repo. Whether you have only a few hundred labeled images or a medium-sized dataset, DINOV3-YOLOV12 helps you get better detection accuracy — without sacrificing speed. Great for niche domains, small-data projects, or quick prototyping.
해결하는 문제
이 프로젝트는 YOLOv12과 같은 표준 CNN 기반 검출기에서 어려움을 겪는 소규모 또는 복잡한 데이터셋에서의 데이터 효율적인 객체 탐지 문제를 해결합니다. DINOv3의 자기지도 학습 기반 비전 트랜스포머(ViT) 특징을 통합함으로써, 훨씬 적은 학습 이미지로도 높은 정확도(mAP)와 빠른 수렴을 달성할 수 있습니다.
작동 방식
YOLOv12의 속도와 DINOv3의 풍부한 특징 추출 능력을 결합한 하이브리드 아키텍처를 구축합니다. 네 가지 통합 유형을 지원합니다:
- Single: DINOv3를 입력 전처리(P0)에 사용.
- Dual: DINOv3를 백본의 P3 및 P4 레벨에 통합.
- Triple: P0 입력 전처리와 P3 및 P4 백본 강화를 결합.
- DualP0P3: P0 전처리와 P3 백본 강화를 균형 있게 결합한 접근 방식.
사용자는 공식 DINOv3 변형(ViT-S, ViT-B, ViT-L 등)과 함께 YOLOv12의 다섯 가지 크기 중에서 자유롭게 조합하여 40가지 이상의 다양한 모델 조합을 만들 수 있습니다.
대상 사용자
- AI 연구자 및 개발자: 라벨링된 데이터가 제한된 니치 분야의 객체 탐지 작업을 수행하는 분들.
- 자율주행 엔지니어: KITTI 데이터셋과 같은 복잡한 환경에서 고정밀 탐지가 필요한 분들.
- 프로덕션 ML 엔지니어: 추론 속도와 탐지 정확도 사이의 균형을 추구하는 분들.
주요 특징
- 엄청난 성능 향상: KITTI와 같은 복잡한 데이터셋에서 최대 88.6%의 mAP 향상, 소규모 데이터셋에서는 15-25% 향상.
- 데이터 효율성: 최적 성능에 도달하기 위한 에포크 수를 50-70% 감소.
- 유연한 통합: Single, Dual, Triple, DualP0P3의 다양한 통합 수준을 지원하여 VRAM 사용량과 정확도의 균형을 조절 가능.
- 정확한 상태 복원: 61개의 하이퍼파라미터와 손실 값을 완벽하게 복원하는 견고한 학습 재개 시스템으로 학습 과정의 급등 현상 방지.
- 사용자 정의 가중치 지원: 로컬
.pth,.pt,.safetensors형식의 DINO 가중치 파일을 로드할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트