linto-ai/whisper-timestamped

Multilingual Automatic Speech Recognition with word-level timestamps and confidence

解决的问题

OpenAI 的 Whisper 模型提供高质量的多语言语音识别,但缺乏精确的单词级时间戳,通常仅提供近似的段落级时间(精度往往只有 1 秒)。whisper-timestamped 通过预测准确的单词时间戳,并提供更精确的语音段落估计,解决了这一问题。

工作原理

该项目基于动态时间规整(DTW)应用于交叉注意力权重的方法实现。这使得系统在每个语音段解码后能够实时将单词与音频信号对齐,通常无需额外的推理步骤。它还为每个单词和段落分配置信度分数。

适用人群

需要高精度时间戳的开发者和研究人员,例如用于创建准确字幕、音频与文本对齐,或跨多种语言分析语音模式。

主要亮点

  • 单词级精度:预测每个单词的精确开始和结束时间。
  • 置信度评分:为每个单词和段落分配置信度分数。
  • 内存高效:与标准 Whisper 相比,处理长音频文件时额外内存开销极小。
  • 支持 VAD:通过 Silero、Auditok 支持语音活动检测(VAD),防止静音期间产生幻觉。
  • 多语言支持:兼容 openai-whisper 的任意版本,并支持 Hugging Face Hub 上的微调模型。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • Dispatch