Hugging Face 目标检测排行榜
Hugging Face 发布了一个目标检测排行榜,使用 COCO 风格的指标对开源模型进行排名,并发表了一篇博客,解释了如何计算平均精度(Average Precision,AP)和平均召回率(Average Recall,AR),以及哪些因素可能影响结果。
介绍
该博客详细解释了目标检测模型的评估过程,阐述了排行榜中使用的指标以及可能导致结果偏差的陷阱。
什么是目标检测
目标检测能够识别并定位图像中的单个对象,为每个检测提供类别标签、边界框和置信度分数。
指标
平均精度(AP)总结了 Precision‑Recall 曲线,而平均召回率(AR)则关注在不同 IoU 阈值下的召回率。
什么是平均精度以及如何计算?
AP 是某一类别的 Precision‑Recall 曲线下的面积;Precision = TP/(TP+FP) 且 Recall = TP/(TP+FN),其中 TP、FP、FN 取决于 IoU 阈值。
什么是平均召回率以及如何计算?
AR 是在 IoU 阈值从 0.5 到 0.95 范围内获得的最大召回率的平均值,可选择根据检测数量或对象大小进行限制。
平均精度和平均召回率的变体有哪些?
变体包括 AP@.5、AP@.75、AP@[.5:.05:.95](mAP)、AP‑S/M/L(用于小/中/大对象),以及 AR‑1/AR‑10/AR‑100 加上 AR‑S/M/L(用于以召回率为重点的评估)。
目标检测排行榜
该排行榜基于 COCO val 2017 上的 12 个 COCO 风格的指标对模型进行排名,准确度通过 PyCOCOtools 进行测量,效率则以 batch size = 1 时的每秒帧数(FPS)来衡量。
如何根据指标选择最佳模型?
选择 AP 以衡量整体性能,AP@.5 用于宽松的定位,AP@.75 用于严格的定位,AP‑S/M/L 用于特定尺寸的任务,而在召回率是优先考虑时选择 AR 的变体。
哪些参数会影响平均精度的结果?
可能改变 AP 的因素包括置信度分数阈值、batch size > 1、logits 被修改的移植模型、被忽略的地面真实标签(如 iscrowd)、IoU 计算细节以及针对文本条件模型的提示质量。
结论
评估目标检测需要仔细考虑模型的具体特性、数据集特征以及指标选择;该排行榜使用社区公认的 COCO 评估代码提供了标准化的比较。
附加资源
- 目标检测指南
- 目标检测任务
- Paper: 有效检测提案的要素
- Paper: 目标检测指标的比较分析及伴随开源工具包
- Paper: 目标检测算法性能指标的调查
Sources
- OriginalObject Detection Leaderboard