m-bain/whisperX

WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)

해결하는 문제

WhisperX는 훨씬 빠른 전사 속도, 더 정확한 단어 단위 타임스탬프 및 통합된 화자 분리 기능을 제공하여 OpenAI의 Whisper를 개선합니다. 이는 몇 초의 오차가 발생할 수 있는 발화 단위 타임스탬프 문제와 기존 Whisper 모델의 네이티브 배치 처리 부재 문제를 해결합니다.

작동 방식

WhisperX는 오디오를 처리하기 위해 다단계 파이프라인을 사용합니다:

  1. Transcription: faster-whisper 백엔드를 사용하여 배치 추론을 수행하며, 최대 실시간의 70배 속도를 구현합니다.
  2. Alignment: 정확한 단어 단위 타임스탬프를 달성하기 위해 음소 기반 ASR 모델(예: wav2vec2.0)을 사용하여 전사 내용을 오디오에 강제 정렬합니다.
  3. Diarization: pyannote-audio를 통합하여 오디오 스트림을 분할하고 전사 내용에 화자 ID 레이블을 할당합니다.
  4. Preprocessing: Voice Activity Detection (VAD)를 사용하여 환각(hallucination)을 줄이고 단어 오류율(WER) 저하 없이 효율적인 배치를 가능하게 합니다.

대상 사용자

이 도구는 긴 오디오 녹음에 대해 화자 식별이 포함된 고속의 정확한 음성-텍스트 전사가 필요한 개발자와 연구자를 위해 설계되었습니다.

주요 특징

  • 극한의 속도: large-v2를 사용하여 최대 실시간의 70배 속도로 전사.
  • 단어 단위 정밀도: 강제 음소 정렬을 통한 정확한 타임스탬프.
  • 화자 식별: 누가 말하고 있는지 레이블을 지정하는 통합 화자 분리 기능.
  • 효율적인 메모리: beam size 5의 large-v2 사용 시 8GB 미만의 GPU 메모리 필요.
  • 다국어 지원: 영어, 프랑스어, 독일어, 스페인어, 이탈리아어를 포함한 여러 언어를 지원하며 자동 정렬 모델 선택 기능을 제공합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트