m-bain/whisperX

WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)

解决的问题

WhisperX 通过提供显著提高的转录速度、更准确的词级时间戳和集成的说话人日志功能,对 OpenAI 的 Whisper 进行了改进。它解决了常见的发话级时间戳可能偏差数秒以及原始 Whisper 模型缺乏原生批处理功能的问题。

工作原理

WhisperX 使用多阶段流水线来处理音频:

  1. Transcription: 利用 faster-whisper 后端进行批处理推理,实现高达实时 70 倍的速度。
  2. Alignment: 为了实现精确的词级时间戳,它使用基于音素的 ASR 模型(如 wav2vec2.0)对转录内容进行强制对齐。
  3. Diarization: 集成了 pyannote-audio 来划分音频流并为转录内容分配说话人 ID 标签。
  4. Preprocessing: 使用语音活动检测 (VAD) 来减少幻觉,并在不降低字错率 (WER) 的情况下实现高效的批处理。

适用对象

该工具专为需要针对长音频录音进行高速、时间准确且带有说话人识别的语音转文本转录的开发人员和研究人员设计。

亮点

  • 极速体验: 使用 large-v2 可实现高达实时 70 倍的转录速度。
  • 词级精度: 通过强制音素对齐实现准确的时间戳。
  • 说话人识别: 集成的说话人日志功能,用于标记说话者。
  • 高效内存: 在 beam size 为 5 的情况下,使用 large-v2 仅需不到 8GB 的 GPU 显存。
  • 多语言支持: 支持包括英语、法语、德语、西班牙语和意大利语在内的多种语言,并具有自动对齐模型选择功能。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目