Open ASR Leaderboard 新增用於印地語和印度英語的 Monsoon 資料集
Hugging Face 與 Voice Arena 已透過引入印地語 (hi-IN) 與印度英語 (en-IN) 的 Monsoon 評估集,擴展了 Open ASR Leaderboard。此次更新將首個「全球南方」(Global South) 語言引入排行榜的多語言分頁,從單純的總體字錯誤率 (WER) 轉向揭示 ASR 性能在地理、年齡、性別和設備類型之間的差異。
解決 ASR 評估中的人口統計偏見
總體 WER 往往會掩蓋不同說話者群體之間顯著的性能差異。研究指出,與白人說話者相比,商業 ASR 系統在處理黑人說話者的表現可能顯著較差,且在性別、年齡和口音方面也存在進一步的偏見。
為了應對這一點,Monsoon 資料集提供了一個框架,其測試集沿著九個特定維度進行變化,以揭示這些失效模式:
- 地理位置: 在數百個地區進行招募,而非僅限於少數地點。
- 設備與聲學環境: 使用貢獻者自己的手機和真實世界的連接(室內與室外),而非錄音室硬體。
- 詞彙、說話類型與速率: 設計提示詞以引發意見、分歧、敘述和回憶,以捕捉未經排練的措辭和命名實體。
- 人口統計: 驗證每位說話者的年齡與性別。
- 參考文本的靈活性: 支持同一段音訊對應多個有效的轉錄文本。
資料集組成與說話者多樣性
Monsoon 系列包含四個拆分集(兩種語言皆有公開與私有集),其來源於未經劇本的雙聲道自發性對話。
| Set | Language | Duration | Speakers | Mean/Median Clip Length | M/F | Districts | Devices | Style |
|---|---|---|---|---|---|---|---|---|
| Monsoon en-IN public | Indian English | 5.62 h | 1,444 | 9.6s / 10.4s | 50/50 | 428 | 556 | Conversational |
| Monsoon en-IN private | Indian English | 5.58 h | 1,405 | 9.6s / 10.4s | 45/55 | 420 | 560 | Conversational |
| Monsoon hi-IN public | Hindi | 1.33 h | 468 | 6.4s / 5.0s | 315 | 202 | 315 | Conversational |
| Monsoon hi-IN private | Hindi | 4.47 h | 1,571 | 6.6s / 5.3s | 55/45 | 295 | 582 | Conversational |
關鍵多樣性指標
- 低說話者集中度: 前 10 名說話者的總時長僅佔 2.8% 至 6.8%,確保沒有單一聲音主導評分。
- 硬體差異: 錄音涵蓋了 315 至 582 種不同的設備型號,防止對特定麥克風響應的過度擬合。
- 區域代表性: 印度英語集涵蓋了印度的所有六個區域,其中 35% 的片段來自南部說話者,18% 來自東部,18% 來自中部,16% 來自北部,以及 11% 來自西部。
區域性能差異
包含詳細的元數據(每個片段包含 12 個屬性,包括職業、教育程度和原籍地區)使得能夠對模型的失效進行細粒度分析。
在對公開的印度英語拆分集進行的一項說明性測試中,八個模型顯示出幾乎相同的總體 WER (在 4.81 與 4.99 之間)。然而,當按區域拆分時,差異變得非常明顯:mistralai/Voxtral-Mini-3B-2507 在不同區域間的變動幅度達 1.68 分,其在中部區域 (4.38) 的表現顯著優於東部 (6.06)。這證明了在標準排行榜上看起來表現一致的模型,根據說話者的來源,其可靠性可能大有不同。
處理印地語的正字法變異
印地語面臨著獨特的挑戰,因為它對許多拼寫方式缺乏標準化的映射,特別是對於語碼混合 (code-mixed) 的英語單詞和複合形式。標準 WER 會因為模型選擇了與標註員特定的選擇不同的有效正字法變體而對模型進行懲罰。
為了這個問題,印地語集使用了格點 (lattice)——即轉錄文本中每個片段的所有被接受的正確拼寫列表。Hugging Face 現在針對印地語報告 正字法知情字錯誤率 (OIWER),這會將格點中任何被接受的形式都視為正確。
將 WER 與 OIWER 進行比較可以發現排名可能會發生翻轉;一個系統可能僅僅因為它剛好符合標註員的拼寫偏好,而非因為其聲學識別能力較強,而在單一參考文本下顯得優越。
整合與評估流程
- Indian English: 整合進主排行榜作為
Voice Arena Monsoon,貢獻於頭條的平均 WER。 - Hindi: 可於多語言分頁中取得,並透過「Language dataset breakdown」下拉選單取得。
若要針對私有拆分集進行評估,開發者必須透過 Open ASR Leaderboard GitHub 提交其模型,並提供公開集的結果以供驗證,隨後 Hugging Face 團隊將會在私有數據上計算指標。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch