Hugging Face 物件偵測排行榜

Hugging Face 發布了一個使用 COCO 風格指標的物件偵測排行榜,對開源模型進行排名,並發表了一篇部落格,解釋如何計算平均精度 (Average Precision) 和平均召回率 (Average Recall),以及哪些因素可能影響結果。

介紹

此部落格解釋了物件偵測模型的評估過程,詳細說明了排行榜所使用的指標,以及可能導致結果分歧的陷阱。

什麼是物件偵測

物件偵測會識別並定位圖像中的單個物體,為每個檢測提供類別標籤、邊界框和信心分數。

指標

平均精度 (AP) 總結了 Precision‑Recall 曲線,而平均召回率 (AR) 則關注在不同 IoU 閾值下的召回率。

什麼是平均精度以及如何計算?

AP 是指定類別在 Precision‑Recall 曲線下的面積;Precision = TP/(TP+FP) 且 Recall = TP/(TP+FN),其中 TP/FP/FN 取決於 IoU 閾值。

什麼是平均召回率以及如何計算?

AR 是在 IoU 閾值從 0.5 到 0.95 範圍內所獲得的最大召回率的平均值,可選擇性地受到檢測數量或物體大小的限制。

平均精度和平均召回率有哪些變體?

變體包括 AP@.5、AP@.75、AP@[.5:.05:.95] (mAP)、AP‑S/M/L(用於小/中/大物體),以及 AR‑1/AR‑10/AR‑100 加上 AR‑S/M/L,用於以召回為重點的評估。

物件偵測排行榜

該排行榜在 COCO val 2017 上使用 12 個 COCO 風格的指標對模型進行排名,準確度透過 PyCOCOtools 測量,效率則以每秒幀數(FPS)衡量,批次大小為 1。

如何根據指標選擇最佳模型?

選擇 AP 來評估整體表現,AP@.5 用於寬鬆的定位,AP@.75 用於嚴格的定位,AP‑S/M/L 用於特定尺寸的任務,當召回率是優先考量時則選擇 AR 的變體。

哪些參數會影響平均精度的結果?

可能改變 AP 的因素包括信心分數閾值、批次大小 > 1、logit 被修改的移植模型、被忽略的 ground‑truth 標籤(如 iscrowd)、IoU 計算細節,以及用於文字條件模型的提示品質。

結論

評估物件偵測時需要仔細考慮模型具體特性、資料集特徵以及指標選擇;該排行榜採用社群接受的 COCO 評估程式碼,提供標準化的比較。

其他資源

  • 物件偵測指南
  • 物件偵測任務
  • Paper: 什麼構成了有效的偵測提案
  • Paper: 伴隨開源工具包的物件偵測指標比較分析
  • Paper: 物件偵測算法效能指標的調查

Sources