Picovoice/speech-to-text-benchmark
speech to text benchmark framework
What it solves
它提供一个标准化、极简且可扩展的框架,用来比较各种语音转文字(STT)引擎的性能。开发者可以使用一致的数据集和指标,依据准确度、速度和资源消耗来评估不同模型。
How it works
该框架会将选定的 STT 引擎对多个公开数据集(如 LibriSpeech、Common Voice、TED-LIUM)执行测试,并计算以下性能指标:
- Accuracy: 通过 Word Error Rate(WER)和 Punctuation Error Rate(PER)衡量。
- Efficiency: 通过“Core‑Hour”(处理一小时音频所需的 CPU 时间)和模型大小(MB)衡量。
- Responsiveness: 通过流式引擎的 Word Emission Latency 测量,追踪说出单词到转写完成的延迟。
它支持批处理和流式模式,且可处理多种语言,包括英语、法语、德语、西班牙语、意大利语和葡萄牙语。
Who it’s for
需要根据准确度、延迟与计算成本之间的权衡,为特定应用选择最合适语音转文字引擎的开发者和研究人员。
Highlights
- Broad Engine Support: 基准测试多家供应商,包括 OpenAI Whisper、Google、Amazon、Azure、IBM Watson、Vosk、Moonshine 与 Picovoice。
- Multi-Metric Evaluation: 超越单纯准确度,还包括标点错误、CPU 效率与实时延迟。
- Diverse Datasets: 整合多个行业标准数据集以提升测试的完整性。
- Extensible Design: 以框架形式构建,可扩展加入新引擎或数据集。