Sompote/DINOV3-YOLOV12
Use DINOv3’s powerful, self-supervised visual features + YOLOv12’s blazing-fast detection, all in one repo. Whether you have only a few hundred labeled images or a medium-sized dataset, DINOV3-YOLOV12 helps you get better detection accuracy — without sacrificing speed. Great for niche domains, small-data projects, or quick prototyping.
何を解決するか
このプロジェクトは、標準的なCNNベースの検出器(例:YOLOv12)が苦戦する小規模または複雑なデータセットにおけるデータ効率的な物体検出の課題に対処します。DINOv3の自己教師付きVision Transformer(ViT)特徴を統合することで、はるかに少ない訓練画像で高い精度(mAP)と高速な収束を達成できるようになります。
仕組み
YOLOv12の高速性とDINOv3の豊かな特徴抽出能力を組み合わせたハイブリッドアーキテクチャを構築します。4種類の統合タイプをサポートしています:
- Single:DINOv3を入力前処理(P0)に使用。
- Dual:DINOv3をバックボーンのP3およびP4レベルに統合。
- Triple:P0の入力前処理とP3・P4のバックボーン強化を組み合わせ。
- DualP0P3:P0前処理とP3バックボーン強化をバランスよく統合するアプローチ。
ユーザーはYOLOv12の5種類のサイズと公式DINOv3バリアント(例:ViT-S、ViT-B、ViT-L)を自由に組み合わせ、40種類以上の異なるモデル構成を作成可能です。
対象ユーザー
- AI研究者および開発者:ラベル付きデータが限られたニッチ分野の物体検出に取り組む方。
- 自動運転エンジニア:複雑なシーン(例:KITTIデータセット)で高精度検出が必要な方。
- プロダクションMLエンジニア:推論速度と検出精度のバランスを求める方。
特徴
- 大幅なパフォーマンス向上:KITTIなどの複雑なデータセットで最大88.6%のmAP向上、小規模データセットでは15-25%向上。
- データ効率性:最適なパフォーマンスに必要なエポック数を50-70%削減。
- 柔軟な統合:Single、Dual、Triple、DualP0P3の複数の統合レベルをサポートし、VRAM使用量と精度のバランスを調整可能。
- 正確な状態復元:61のハイパーパラメータと損失値を完全に復元する堅牢なトレーニング再開システムで、トレーニングのスパイクを回避。
- カスタム重みサポート:ローカルの
.pth、.pt、.safetensors形式のDINO重みファイルを読み込み可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト