m-bain/whisperX

WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)

解決的問題

WhisperX 透過提供顯著提高的轉錄速度、更準確的詞級時間戳以及整合的說話人日誌功能,對 OpenAI 的 Whisper 進行了改進。它解決了常見的發話級時間戳可能偏差數秒,以及原始 Whisper 模型缺乏原生批次處理功能的問題。

工作原理

WhisperX 使用多階段流水線來處理音訊:

  1. Transcription: 利用 faster-whisper 後端進行批次推理,實現高達實時 70 倍的速度。
  2. Alignment: 為了實現精確的詞級時間戳,它使用基於音素的 ASR 模型(如 wav2vec2.0)對轉錄內容進行強制對齊。
  3. Diarization: 整合了 pyannote-audio 來劃分音訊串流並為轉錄內容分配說話人 ID 標籤。
  4. Preprocessing: 使用語音活動檢測 (VAD) 來減少幻覺,並在不降低字錯率 (WER) 的情況下實現高效的批次處理。

適用對象

該工具專為需要針對長音訊錄音進行高速、時間準確且帶有說話人識別的語音轉文本轉錄的開發人員和研究人員設計。

亮點

  • 極速體驗: 使用 large-v2 可實現高達實時 70 倍的轉錄速度。
  • 詞級精度: 透過強制音素對齊實現準確的時間戳。
  • 說話人識別: 整合的說話人日誌功能,用於標記說話者。
  • 高效記憶體: 在 beam size 為 5 的情況下,使用 large-v2 僅需不到 8GB 的 GPU 顯存。
  • 多語言支援: 支援包括英語、法語、德語、西班牙語和義大利語在內的多種語言,並具有自動對齊模型選擇功能。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案