허깅 페이스 오픈 ASR 리더보드: 벤치맥싱 방지를 위한 비공개 데이터셋

허깅 페이스는 Appen Inc.와 DataoceanAI가 제공한 비공개 평가 데이터셋을 오픈 ASR 리더보드에 통합했습니다. 이 업데이트는 공개 벤치마크 테스트 세트에 모델을 특별히 최적화하는 관행인 "benchmaxxing"을 방지하고, 다양한 실제 세계 오디오 조건에서 자동 음성 인식 (ASR) 모델의 성능을 더 신뢰할 수 있는 측정값을 제공하는 것을 목표로 합니다.

비공개 데이터로 벤치맥싱 방지

리더보드 순위가 특정 공개 데이터셋에 대한 최적화가 아닌 진정한 모델 견고성을 반영하도록 하기 위해, 허깅 페이스는 새로운 고품질 데이터셋을 비공개로 유지하고 있습니다. 이 접근 방식은 개발자가 공개 테스트 세트를 명시적으로 훈련에 사용하거나 그와 유사한 데이터를 찾아 인위적으로 macroaverage 점수를 높이는 테스트 세트 오염 위험을 완화합니다.

새로운 평가 데이터셋 및 적용 범위

Appen Inc.와 DataoceanAI는 다양한 악센트, 스타일, 전사 유형을 다루는 데이터셋을 기여했습니다. 이러한 데이터셋은 대상별 성능 분석을 가능하게 하기 위해 다음과 같이 분류됩니다:

데이터셋 악센트 지속 시간 [h] 남성 (%) / 여성 (%) 스타일 전사
Appen Scripted AU 호주 1.42 49 / 51 읽기 구두점 포함, 대소문자 구분
Appen Scripted CA 캐나다 1.53 52 / 48 읽기 구두점 포함, 대소문자 구분
Appen Scripted IN 인도 1.02 49 / 51 읽기 구두점 포함, 대소문자 구분
Appen Scripted US 미국 1.45 49 / 51 읽기 구두점 포함, 대소문자 구분
Appen Conversational IN 인도 1.37 51 / 49 대화형, 즉흥적 구두점 포함, 비유창음
Appen Conversational US003 미국 1.64 49 / 51 대화형, 즉흥적 구두점 포함, 대소문자 구분, 비유창음
Appen Conversational US004 미국 1.65 49 / 51 대화형, 즉흥적 구두점 포함, 비유창음
DataoceanAI Scripted US 미국 2.43 54 / 46 읽기 구두점 포함, 대소문자 구분 (고유명사), 비유창음
DataoceanAI Scripted GB 영국 2.43 47 / 53 읽기 구두점 포함, 비유창음
DataoceanAI Conversational US 미국 8.82 NA 대화형, 즉흥적 구두점 포함, 비유창음
DataoceanAI Conversational GB 영국 5.96 NA 대화형, 즉흥적 구두점 포함, 비유창음

대상별 메트릭 및 리더보드 기능

리더보드는 이제 성능의 미세한 차이를 강조하기 위한 특정 macroaverage 메트릭이 있는 "Private data" 탭을 포함합니다.

  • Average WER: 데이터 공급자 평균의 매크로 평균으로, 공급자 간의 가중치를 동일하게 보장합니다.
  • Avg Scripted: 모든 스크립트 데이터셋의 매크로 평균.
  • Avg Conversational: 모든 대화형 데이터셋에 걸친 ASR 성능.
  • Avg US: 미국 악센트를 특징으로 하는 모든 데이터셋의 매크로 평균.
  • Avg non-US: 비미국 악센트를 특징으로 하는 모든 데이터셋의 매크로 평균.

개발자가 특정 악센트 또는 공급자에 최적화하지 못하도록, 각 분할에 대한 개별 점수는 제공되지 않습니다. 기본적으로, 리더보드의 평균 단어 오류율 (WER)은 공개 데이터셋만을 기준으로 계산된 상태로 유지됩니다. 사용자는 수동으로 "Private data" 분할을 켜서 포함시켰을 때 macroaverage 및 결과 모델 순위 (Rank Δ)에 어떤 영향을 미치는지 확인할 수 있습니다.

모델 평가 프로세스

모델 개발자는 다음 단계를 따라 비공개 데이터에서 모델 평가를 받을 수 있습니다.

  1. Open ASR Leaderboard GitHub 저장소에 풀 리퀘스트를 제출합니다.
  2. 모델 체크리스트를 통해 공개 데이터셋에서의 결과를 보고합니다.
  3. 허깅 페이스는 공개 결과를 검증하고 비공개 데이터셋에 대한 메트릭을 계산합니다.
  4. 개발자는 최종 결과를 확인합니다.

대안적으로, 개발자는 모델 카드에 YAML 파일을 추가하여 공개 세트에 대한 메트릭을 자체 보고할 수 있으며,これにより 데이터셋 페이지에서 검증되지 않은 리더보드에 모델이 배치됩니다.

표준화 및 견고성

의미 있는 벤치마크를 유지하기 위해, 허깅 페이스는 OpenAI Whisper 정규화기를 기반으로 한 정규화기를 사용합니다. 이 도구는 구두점과 대소문자를 제거하고 텍스트를 미국식 철자로 매핑하여 모델 출력 및 데이터셋 전사를 표준화합니다. 모든 테스트 세트는 허브에서 단일 데이터셋으로 통합되어 접근 및 미리보기가 용이합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch