linto-ai/whisper-timestamped
Multilingual Automatic Speech Recognition with word-level timestamps and confidence
解决的问题
OpenAI 的 Whisper 模型提供高质量的多语言语音识别,但缺乏精确的单词级时间戳,通常仅提供近似的段落级时间(精度往往只有 1 秒)。whisper-timestamped 通过预测准确的单词时间戳,并提供更精确的语音段落估计,解决了这一问题。
工作原理
该项目基于动态时间规整(DTW)应用于交叉注意力权重的方法实现。这使得系统在每个语音段解码后能够实时将单词与音频信号对齐,通常无需额外的推理步骤。它还为每个单词和段落分配置信度分数。
适用人群
需要高精度时间戳的开发者和研究人员,例如用于创建准确字幕、音频与文本对齐,或跨多种语言分析语音模式。
主要亮点
- 单词级精度:预测每个单词的精确开始和结束时间。
- 置信度评分:为每个单词和段落分配置信度分数。
- 内存高效:与标准 Whisper 相比,处理长音频文件时额外内存开销极小。
- 支持 VAD:通过 Silero、Auditok 支持语音活动检测(VAD),防止静音期间产生幻觉。
- 多语言支持:兼容
openai-whisper的任意版本,并支持 Hugging Face Hub 上的微调模型。
相关
- 项目
- Dispatch
- 项目
- 项目
- Dispatch