m-bain/whisperX
WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)
해결하는 문제
WhisperX는 훨씬 빠른 전사 속도, 더 정확한 단어 단위 타임스탬프 및 통합된 화자 분리 기능을 제공하여 OpenAI의 Whisper를 개선합니다. 이는 몇 초의 오차가 발생할 수 있는 발화 단위 타임스탬프 문제와 기존 Whisper 모델의 네이티브 배치 처리 부재 문제를 해결합니다.
작동 방식
WhisperX는 오디오를 처리하기 위해 다단계 파이프라인을 사용합니다:
- Transcription:
faster-whisper백엔드를 사용하여 배치 추론을 수행하며, 최대 실시간의 70배 속도를 구현합니다. - Alignment: 정확한 단어 단위 타임스탬프를 달성하기 위해 음소 기반 ASR 모델(예:
wav2vec2.0)을 사용하여 전사 내용을 오디오에 강제 정렬합니다. - Diarization:
pyannote-audio를 통합하여 오디오 스트림을 분할하고 전사 내용에 화자 ID 레이블을 할당합니다. - Preprocessing: Voice Activity Detection (VAD)를 사용하여 환각(hallucination)을 줄이고 단어 오류율(WER) 저하 없이 효율적인 배치를 가능하게 합니다.
대상 사용자
이 도구는 긴 오디오 녹음에 대해 화자 식별이 포함된 고속의 정확한 음성-텍스트 전사가 필요한 개발자와 연구자를 위해 설계되었습니다.
주요 특징
- 극한의 속도:
large-v2를 사용하여 최대 실시간의 70배 속도로 전사. - 단어 단위 정밀도: 강제 음소 정렬을 통한 정확한 타임스탬프.
- 화자 식별: 누가 말하고 있는지 레이블을 지정하는 통합 화자 분리 기능.
- 효율적인 메모리: beam size 5의
large-v2사용 시 8GB 미만의 GPU 메모리 필요. - 다국어 지원: 영어, 프랑스어, 독일어, 스페인어, 이탈리아어를 포함한 여러 언어를 지원하며 자동 정렬 모델 선택 기능을 제공합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트