sunsmarterjie/yolov12
[NeurIPS 2025] YOLOv12: Attention-Centric Real-Time Object Detectors
解決的問題
YOLOv12 解決了即時物件偵測中速度與準確性之間的權衡問題。雖然注意力機制通常比 CNN 提供更優越的建模能力,但它們通常太慢而無法用於即時應用。YOLOv12 提供了一個以注意力為中心的框架,在利用注意力機制性能優勢的同時,達到了與基於 CNN 的偵測器相當的速度。
運作原理
它實現了一種專為高效率即時性能而設計的注意力中心架構。該專案提供了多種模型規模(Nano、Small、Medium、Large 和 X-Large),並支援三種主要的電腦視覺任務:物件偵測、實例分割和影像分類。它建立在 Ultralytics 框架之上,便於進行訓練、驗證以及匯出至 TensorRT 和 ONNX 等格式。
適用對象
需要在 GPU(如 T4)或邊緣裝置上進行高準確度、即時物件偵測、分割或分類的電腦視覺工程師與研究人員。
特點
- 以注意力為中心的設計:結合了注意力機制的準確性與 CNN 的速度。
- 多任務支援:包含用於偵測、實例分割和分類的專用模型。
- 高效率:在準確性與速度的權衡上優於先前的 YOLO 版本(v10、v11)和 RT-DETR。
- Turbo 版本:提供「Turbo」變體以實現更快的推論速度。
- 靈活部署:支援匯出至 TensorRT 和 ONNX,以便在 Android 或其他邊緣裝置上進行部署。
相關
- 專案
- 專案
- 專案
- 專案