sunsmarterjie/yolov12

[NeurIPS 2025] YOLOv12: Attention-Centric Real-Time Object Detectors

해결하는 문제

YOLOv12는 실시간 객체 탐지에서 속도와 정확도 사이의 트레이드오프 문제를 해결합니다. 어텐션 메커니즘은 일반적으로 CNN보다 뛰어난 모델링 능력을 제공하지만, 실시간으로 사용하기에는 너무 느린 경우가 많습니다. YOLOv12는 어텐션의 성능상 이점을 활용하면서도 CNN 기반 탐지기와 동일한 속도를 제공하는 어텐션 중심 프레임워크를 제공합니다.

작동 원리

고효율 실시간 성능을 위해 설계된 어텐션 중심 아키텍처를 구현합니다. 이 프로젝트는 다양한 모델 규모(Nano, Small, Medium, Large, X-Large)를 제공하며, 객체 탐지, 인스턴스 세그멘테이션, 이미지 분류라는 세 가지 주요 컴퓨터 비전 작업을 지원합니다. Ultralytics 프레임워크를 기반으로 구축되어 학습, 검증 및 TensorRT나 ONNX와 같은 형식으로의 내보내기가 쉽습니다.

대상 사용자

GPU(T4 등) 또는 엣지 디바이스에서 고정밀 실시간 객체 탐지, 세그멘테이션 또는 분류가 필요한 컴퓨터 비전 엔지니어 및 연구자.

주요 특징

  • 어텐션 중심 설계: 어텐션 메커니즘의 정확도와 CNN의 속도를 결합.
  • 멀티태스크 지원: 탐지, 인스턴스 세그멘테이션, 분류를 위한 전용 모델 포함.
  • 고효율: 정확도와 속도 트레이드오프 측면에서 이전 YOLO 버전(v10, v11) 및 RT-DETR보다 우수한 성능.
  • Turbo 버전: 더 빠른 추론을 위한 "Turbo" 변형 제공.
  • 유연한 배포: TensorRT 및 ONNX로의 내보내기를 지원하여 Android 또는 기타 엣지 디바이스에 배포 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트