Hugging Face 開放 ASR 排行榜:私有資料集以對抗 Benchmaxxing

Hugging Face 已將 Appen Inc. 與 DataoceanAI 提供的私有評估資料集整合至 Open ASR Leaderboard。此更新旨在防止「benchmaxxing」——即專門針對公開基準測試集進行模型優化的做法,並提供更可信的衡量方式,評估自動語音辨識(ASR)模型在多樣、真實世界音訊條件下的表現。

使用私有資料防止 Benchmaxxing

為確保排行榜排名反映真實的模型韌性,而非對特定公開資料集的優化,Hugging Face 將新高品質資料集保持私有。此做法降低測試集污染的風險,避免開發者直接使用公開測試集進行訓練,或尋找與之極為相似的資料以人為提升 macroaverage 分數。

雖然 Open ASR Leaderboard 仍透過開源 UI 程式碼與評估腳本維持開放精神,私有資料的加入則在必要時取得平衡。透過開發者無法取得的資料,排行榜能更精確地找出模型表現的缺口與偏差,尤其是在對話式語音與非美式口音等未飽和情境中。

新的評估資料集與覆蓋範圍

Appen Inc. 與 DataoceanAI 提供了涵蓋多種口音、風格與轉寫類型的資料集。這些資料集已分類,以便進行目標化的效能分析:

資料集 口音 時長 [h] 男性 (%) / 女性 (%) 風格 轉寫
Appen Scripted AU 澳洲 1.42 49 / 51 朗讀 標點、大小寫
Appen Scripted CA 加拿大 1.53 52 / 48 朗讀 標點、大小寫
Appen Scripted IN 印度 1.02 49 / 51 朗讀 標點、大小寫
Appen Scripted US 美國 1.45 49 / 51 朗讀 標點、大小寫
Appen Conversational IN 印度 1.37 51 / 49 對話式、自然 標點、口吃
Appen Conversational US003 美國 1.64 49 / 51 對話式、自然 標點、大小寫、口吃
Appen Conversational US004 美國 1.65 49 / 51 對話式、自然 標點、口吃
DataoceanAI Scripted US 美國 2.43 54 / 46 朗讀 標點、大小寫(專有名詞)、口吃
DataoceanAI Scripted GB 英國 2.43 47 / 53 朗讀 標點、口吃
DataoceanAI Conversational US 美國 8.82 NA 對話式、自然 標點、口吃
DataoceanAI Conversational GB 英國 5.96 NA 對話式、自然 標點、口吃

目標指標與排行榜功能

排行榜現在加入了「私有資料」分頁,提供特定的 macroaverage 指標,以突顯效能細節:

  • Average WER:資料提供者平均值的 macroaverage,確保各提供者權重相等。
  • Avg Scripted:所有朗讀資料集的 macroaverage。
  • Avg Conversational:所有對話式資料集的 ASR 效能。
  • Avg US:所有包含美國口音資料集的 macroaverage。
  • Avg non-US:所有非美國口音資料集的 macroaverage。

為防止開發者針對特定口音或提供者進行優化,個別分割的分數不會顯示。預設情況下,排行榜上的平均字錯率(WER)仍僅以公開資料集計算。使用者可手動切換「私有資料」分割,觀察其對 macroaverage 及模型排名(Rank Δ)的影響。

模型評估流程

模型開發者可依照以下步驟讓模型在私有資料上進行評估:

  1. 在 Open ASR Leaderboard 的 GitHub 倉庫提交 pull request。
  2. 透過模型清單在公開資料集上回報結果。
  3. Hugging Face 驗證公開結果,並計算私有資料集的指標。
  4. 開發者確認最終結果。

另外,開發者也可在模型卡的 YAML 檔案中自行回報公開資料集的指標,這會將模型放置於資料集頁面的未驗證排行榜上。

標準化與韌性

為維持有意義的基準,Hugging Face 採用基於 OpenAI Whisper 正規化器的 normalizer。此工具會透過移除標點與大小寫、並將文字映射為美式拼寫,來標準化模型輸出與資料集轉寫。所有測試集皆匯聚成 Hub 上的單一資料集,方便存取與預覽。

Sources