linto-ai/whisper-timestamped
Multilingual Automatic Speech Recognition with word-level timestamps and confidence
解決的問題
OpenAI 的 Whisper 模型提供高品質的多語言語音辨識,但缺乏精確的單字級時間戳,通常僅提供近似的段落級時間(精度通常僅有 1 秒)。whisper-timestamped 透過預測精確的單字時間戳,並提供更精確的語音段落估計,解決此問題。
工作原理
本專案實作一種基於動態時間扭曲(DTW)應用於交叉注意力權重的方法。這使得系統在每個語音段解碼後能即時將單字與音訊信號對齊,通常無需額外的推論步驟。同時為每個單字與段落分配置信度分數。
適用對象
需要高精度時間戳的開發者與研究人員,例如用於製作精確字幕、音訊與文字對齊,或跨多種語言分析語音模式。
主要特色
- 單字級精確度:預測每個單字的精確開始與結束時間。
- 置信度評分:為每個單字與段落分配置信度分數。
- 記憶體效率高:與標準 Whisper 相比,處理長時間音訊檔案時額外記憶體開銷極小。
- 支援 VAD:透過 Silero、Auditok 支援語音活動檢測(VAD),防止靜音期間產生幻覺。
- 多語言支援:相容
openai-whisper的任意版本,並支援 Hugging Face Hub 上的微調模型。
相關
- 專案
- Dispatch
- 專案
- 專案
- Dispatch