Hugging Face 目标检测排行榜

Hugging Face 发布了一个目标检测排行榜,使用 COCO 风格的指标对开源模型进行排名,并发表了一篇博客,解释了如何计算平均精度(Average Precision,AP)和平均召回率(Average Recall,AR),以及哪些因素可能影响结果。

介绍

该博客详细解释了目标检测模型的评估过程,阐述了排行榜中使用的指标以及可能导致结果偏差的陷阱。

什么是目标检测

目标检测能够识别并定位图像中的单个对象,为每个检测提供类别标签、边界框和置信度分数。

指标

平均精度(AP)总结了 Precision‑Recall 曲线,而平均召回率(AR)则关注在不同 IoU 阈值下的召回率。

什么是平均精度以及如何计算?

AP 是某一类别的 Precision‑Recall 曲线下的面积;Precision = TP/(TP+FP) 且 Recall = TP/(TP+FN),其中 TP、FP、FN 取决于 IoU 阈值。

什么是平均召回率以及如何计算?

AR 是在 IoU 阈值从 0.5 到 0.95 范围内获得的最大召回率的平均值,可选择根据检测数量或对象大小进行限制。

平均精度和平均召回率的变体有哪些?

变体包括 AP@.5、AP@.75、AP@[.5:.05:.95](mAP)、AP‑S/M/L(用于小/中/大对象),以及 AR‑1/AR‑10/AR‑100 加上 AR‑S/M/L(用于以召回率为重点的评估)。

目标检测排行榜

该排行榜基于 COCO val 2017 上的 12 个 COCO 风格的指标对模型进行排名,准确度通过 PyCOCOtools 进行测量,效率则以 batch size = 1 时的每秒帧数(FPS)来衡量。

如何根据指标选择最佳模型?

选择 AP 以衡量整体性能,AP@.5 用于宽松的定位,AP@.75 用于严格的定位,AP‑S/M/L 用于特定尺寸的任务,而在召回率是优先考虑时选择 AR 的变体。

哪些参数会影响平均精度的结果?

可能改变 AP 的因素包括置信度分数阈值、batch size > 1、logits 被修改的移植模型、被忽略的地面真实标签(如 iscrowd)、IoU 计算细节以及针对文本条件模型的提示质量。

结论

评估目标检测需要仔细考虑模型的具体特性、数据集特征以及指标选择;该排行榜使用社区公认的 COCO 评估代码提供了标准化的比较。

附加资源

  • 目标检测指南
  • 目标检测任务
  • Paper: 有效检测提案的要素
  • Paper: 目标检测指标的比较分析及伴随开源工具包
  • Paper: 目标检测算法性能指标的调查

Sources