sunsmarterjie/yolov12

[NeurIPS 2025] YOLOv12: Attention-Centric Real-Time Object Detectors

解決する課題

YOLOv12 は、リアルタイム物体検出における速度と精度のトレードオフを解決します。アテンションメカニズムは通常、CNN よりも優れたモデリング能力を提供しますが、リアルタイム用途には遅すぎることが一般的です。YOLOv12 は、アテンションの性能上の利点を活用しつつ、CNN ベースの検出器と同等の速度を実現するアテンション中心のフレームワークを提供します。

仕組み

高効率なリアルタイム性能を実現するために設計されたアテンション中心のアーキテクチャを実装しています。このプロジェクトでは、複数のモデルスケール(Nano、Small、Medium、Large、X-Large)を提供し、物体検出、インスタンスセグメンテーション、画像分類という3つの主要なコンピュータビジョンタスクをサポートしています。Ultralytics フレームワークに基づいて構築されており、トレーニング、検証、および TensorRT や ONNX などの形式へのエクスポートが容易です。

対象ユーザー

GPU(T4など)やエッジデバイス上で、高精度かつリアルタイムな物体検出、セグメンテーション、または分類を必要とするコンピュータビジョンエンジニアおよび研究者。

ハイライト

  • アテンション中心の設計: アテンションメカニズムの精度と CNN の速度を融合。
  • マルチタスクサポート: 検出、インスタンスセグメンテーション、分類のための専用モデルを同梱。
  • 高効率: 精度と速度のトレードオフにおいて、従来の YOLO バージョン(v10、v11)や RT-DETR を上回る性能を発揮。
  • Turbo バージョン: さらに高速な推論を実現する「Turbo」バリアントを提供。
  • 柔軟なデプロイメント: TensorRT および ONNX へのエクスポートをサポートし、Android やその他のエッジデバイスへのデプロイが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト