Open ASR Leaderboard에 힌디어 및 인도 영어용 Monsoon 데이터셋 추가

Hugging Face와 Voice Arena는 힌디어(hi-IN) 및 인도 영어(en-IN)를 위한 Monsoon 평가 세트를 도입하여 Open ASR Leaderboard를 확장했습니다. 이번 업데이트는 리더보드의 다국어 탭에 최초의 Global South 언어를 도입하며, 단순 합계 Word Error Rate (WER)를 넘어 ASR 성능이 지리적 위치, 연령, 성별 및 기기 유형에 따라 어떻게 달라지는지 보여줍니다.

ASR 평가에서의 인구 통계적 편향 해결

합계 WER은 다양한 화자 집단 간의 상당한 성능 차이를 가리는 경우가 많습니다. 연구에 따르면 상업용 ASR 시스템은 백인 화자에 비해 흑인 화자에 대해 성능이 현저히 떨어질 수 있으며, 성별, 연령, 억양에 따라 추가적인 편향이 나타날 수 있습니다.

이를 해결하기 위해 Monsoon 데이터셋은 이러한 실패 모드를 노출하기 위해 9가지 특정 축을 따라 테스트 세트가 변하는 프레임워크를 제공합니다:

  • Geography: 수백 개의 구역(districts)에서 모집하여 소수의 위치에 국한되지 않도록 합니다.
  • Devices and Acoustic Environments: 스튜디오 하드웨어가 아닌 기여자의 개인 휴대폰과 실제 환경(실내 및 실외)의 연결을 사용합니다.
  • Vocabulary, Speech Type, and Rate: 의견, 반대, 서술, 회상을 유도하도록 설계된 프롬프트를 통해 연습되지 않은 구절과 고유 명사를 포착합니다.
  • Demographics: 모든 화자의 검증된 연령과 성별을 제공합니다.
  • Reference Flexibility: 동일한 오디오에 대해 여러 개의 유효한 전사본(transcripts)을 지원합니다.

데이터셋 구성 및 화자 다양성

Monsoon 컬렉션은 대본이 없는 이중 채널의 자연스러운 대화에서 추출된 4개의 분할(언어별 공용 및 비공용)로 구성됩니다.

Set Language Duration Speakers Mean/Median Clip Length M/F Districts Devices Style
Monsoon en-IN public Indian English 5.62 h 1,444 9.6s / 10.4s 50/50 428 556 Conversational
Monsoon en-IN private Indian English 5.58 h 1,405 9.6s / 10.4s 45/55 420 560 Conversational
Monsoon hi-IN public Hindi 1.33 h 468 6.4s / 5.0s 315 202 315 Conversational
Monsoon hi-IN private Hindi 4.47 h 1,571 6.6s / 5.3s 55/45 295 582 Conversational

주요 다양성 지표

  • Low Speaker Concentration: 상위 10명의 화자가 전체 재생 시간의 2.8%에서 6.8%만을 차지하여, 특정 목소리가 점수에 지배적인 영향을 미치지 않도록 합니다.
  • Hardware Variance: 315개에서 582개의 서로 다른 기기 모델을 사용하여 특정 마이크 응답에 대한 과적합을 방지합니다.
  • Regional Representation: 인도 영어 세트는 인도의 6개 구역을 모두 포함하며, 남부 화자 35%, 동부 18%, 중부 18%, 북부 16%, 서부 11%로 구성됩니다.

지역별 성능 차이

상세한 메타데이터(직업, 교육, 거주 구역 등 세그먼트당 12개의 속성)를 포함함으로써 모델의 실패 원인을 세밀하게 분석할 수 있습니다.

공용 인도 영어 분할 세트에 대한 예시 테스트에서, 8개의 모델이 거의 동일한 합계 WER(4.81에서 4.99 사이)을 보였습니다. 그러나 지역별로 분해했을 때 차이는 극명했습니다: mistralai/Voxtral-Mini-3B-2507은 구역별로 1.68점의 차이를 보려, 중부 구역(4.38)에서는 성능이 훨씬 좋았지만 동부 구역(6.06)에서는 성능이 낮았습니다. 이는 표준 리더보드에서 동일해 보이는 모델들이 화자의 출신 지역에 따라 매우 다른 신뢰성을 가질 수 있음을 보여줍니다.

힌디어의 철자법적 변이 처리

힌디어는 많은 철자법 중 특히 코드 믹스된 영어 단어와 복합어 형태에 대해 표준적인 매핑이 부족하기 때문에 독특한 문제를 제기합니다. 표준 WER은 전사자가 특정 철자법을 선택했을 것을 기대하고, 모델이 유효한 다른 철자법 변이형을 선택했을 경우 이를 감점 요소로 처리합니다.\n 이를 해결하기 위해 힌디어 세트는 lattice—전사본의 각 구간에 대해 허용되는 모든 올바른 올바른 철자법 목록을 사용합니다. Hugging Face는 이제 힌디어에 대해 **Orthographically-Informed Word Error Rate (OIWER)**를 보고합니다. 이는 lattice에 포함된 어떤 형태든 올바른 것으로 간주합니다.

WER과 OIWER를 비교하면 순위가 뒤바뀔 수 있음을 알 수 있습니다. 어떤 시스템이 단일 참조본을 기준으로 했을 때 우수해 보일 수 있는 것은, 단순히 그 시스템이 더 나은 음향 인식 성능을력을 가진 데가 아니라, 전사자의 철자법 선호도를 우연히 반영하고 있기 때문일 수 있습니다.

통합 및 평가 프로세스

  • Indian English: Voice Arena Monsoon으로 메인 리더보드에 통합되어 헤드라인 Average WER에 기여합니다.
  • Hindi: 다국어 탭과 "Language dataset breakdown" 드롭다운 메뉴를 통해 이용할 수 있습니다.

비공용 분할 세트에 대해 평가를 받으려면, 개발자는 Open ASR Leaderboard GitHub를 통해 모델을 제출해야 합니다. Hugging Face 팀이 비공용 데이터에 대해 지표를를 계산하기 전에, 공용 세트에 대한 결과를 먼저 제공하여 검증을 거합니다니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch