Picovoice/speech-to-text-benchmark
speech to text benchmark framework
What it solves
它提供一個標準化、極簡且可擴充的框架,用來比較各種語音轉文字(STT)引擎的效能。開發者可以使用一致的資料集與指標,依據準確度、速度與資源消耗來評估不同模型。
How it works
此框架會將選定的 STT 引擎對多個公開資料集(如 LibriSpeech、Common Voice、TED-LIUM)執行測試,並計算以下績效指標:
- Accuracy: 以 Word Error Rate(WER)與 Punctuation Error Rate(PER)衡量。
- Efficiency: 以「Core‑Hour」(處理一小時音訊所需的 CPU 時間)與模型大小(MB)衡量。
- Responsiveness: 以串流引擎的 Word Emission Latency 測量,追蹤說出單字到轉寫完成的延遲。
它支援批次與串流模式,並可處理多種語言,包括英文、法文、德文、西班牙文、義大利文與葡萄牙文。
Who it’s for
需要根據準確度、延遲與計算成本之間的取捨,為特定應用選擇最適合語音轉文字引擎的開發者與研究人員。
Highlights
- Broad Engine Support: 基準測試多家供應商,包括 OpenAI Whisper、Google、Amazon、Azure、IBM Watson、Vosk、Moonshine 與 Picovoice。
- Multi-Metric Evaluation: 超越單純準確度,還包括標點錯誤、CPU 效能與即時延遲。
- Diverse Datasets: 整合多個業界標準資料集以提升測試的完整性。
- Extensible Design: 以框架形式構建,可擴充加入新引擎或資料集。