Picovoice/speech-to-text-benchmark

speech to text benchmark framework

What it solves

它提供一个标准化、极简且可扩展的框架,用来比较各种语音转文字(STT)引擎的性能。开发者可以使用一致的数据集和指标,依据准确度、速度和资源消耗来评估不同模型。

How it works

该框架会将选定的 STT 引擎对多个公开数据集(如 LibriSpeech、Common Voice、TED-LIUM)执行测试,并计算以下性能指标:

  • Accuracy: 通过 Word Error Rate(WER)和 Punctuation Error Rate(PER)衡量。
  • Efficiency: 通过“Core‑Hour”(处理一小时音频所需的 CPU 时间)和模型大小(MB)衡量。
  • Responsiveness: 通过流式引擎的 Word Emission Latency 测量,追踪说出单词到转写完成的延迟。

它支持批处理和流式模式,且可处理多种语言,包括英语、法语、德语、西班牙语、意大利语和葡萄牙语。

Who it’s for

需要根据准确度、延迟与计算成本之间的权衡,为特定应用选择最合适语音转文字引擎的开发者和研究人员。

Highlights

  • Broad Engine Support: 基准测试多家供应商,包括 OpenAI Whisper、Google、Amazon、Azure、IBM Watson、Vosk、Moonshine 与 Picovoice。
  • Multi-Metric Evaluation: 超越单纯准确度,还包括标点错误、CPU 效率与实时延迟。
  • Diverse Datasets: 整合多个行业标准数据集以提升测试的完整性。
  • Extensible Design: 以框架形式构建,可扩展加入新引擎或数据集。