Picovoice/speech-to-text-benchmark

speech to text benchmark framework

What it solves

표준화되고 미니멀하며 확장 가능한 프레임워크를 제공하여 다양한 음성‑텍스트(STT) 엔진의 성능을 비교합니다. 개발자는 일관된 데이터셋과 메트릭을 사용해 정확도, 속도, 리소스 소비를 기준으로 모델을 평가할 수 있습니다.

How it works

프레임워크는 선택된 STT 엔진을 여러 공개 데이터셋(LibriSpeech, Common Voice, TED‑LIUM 등)에 적용하고 다음 성능 지표를 계산합니다.

  • Accuracy: Word Error Rate(WER)와 Punctuation Error Rate(PER)로 측정.
  • Efficiency: "Core‑Hour"(1시간 오디오를 처리하는 데 필요한 CPU 시간)와 모델 크기(MB)로 측정.
  • Responsiveness: 스트리밍 엔진의 Word Emission Latency로 측정하여 말한 단어가 전사되는 지연을 추적.

배치 모드와 스트리밍 모드를 모두 지원하며, 영어, 프랑스어, 독일어, 스페인어, 이탈리아어, 포르투갈어 등 여러 언어를 처리합니다.

Who it’s for

정확도, 지연 시간, 계산 비용 사이의 트레이드오프를 고려해 특정 애플리케이션에 가장 적합한 음성‑텍스트 엔진을 선택해야 하는 개발자와 연구자를 위한 도구입니다.

Highlights

  • Broad Engine Support: OpenAI Whisper, Google, Amazon, Azure, IBM Watson, Vosk, Moonshine, Picovoice 등 다양한 공급자를 벤치마크.
  • Multi-Metric Evaluation: 단순 정확도를 넘어 구두점 오류, CPU 효율성, 실시간 지연까지 포함.
  • Diverse Datasets: 산업 표준 데이터셋을 다수 통합해 견고한 테스트 제공.
  • Extensible Design: 새로운 엔진이나 데이터셋을 추가할 수 있도록 설계된 프레임워크.