linto-ai/whisper-timestamped
Multilingual Automatic Speech Recognition with word-level timestamps and confidence
해결하는 문제
OpenAI의 Whisper 모델은 고품질의 다국어 음성 인식을 제공하지만, 정확한 단어 수준의 타임스탬프는 제공하지 않습니다. 일반적으로 약 1초의 정확도로 근사적인 세그먼트 수준의 타임스탬프만 제공합니다. whisper-timestamped는 정확한 단어 타임스탬프를 예측하고 음성 세그먼트에 대한 더 정밀한 추정을 가능하게 함으로써 이 문제를 해결합니다.
작동 방식
이 프로젝트는 크로스 어텐션 가중치에 동적 시간 왜곡(DTW)을 적용하는 접근 방식을 구현합니다. 이는 각 음성 세그먼트가 디코딩된 직후 실시간으로 단어를 오디오 신호에 정렬할 수 있게 해주며, 대부분의 경우 추가 추론 단계가 필요하지 않습니다. 또한 각 단어와 세그먼트에 신뢰도 점수를 할당합니다.
대상 사용자
정확한 자막 생성, 오디오-텍스트 정렬, 또는 여러 언어에서의 발화 패턴 분석과 같은 작업에서 고정밀 타이밍이 필요한 개발자 및 연구자에게 적합합니다.
주요 특징
- 단어 수준 정밀도: 개별 단어의 정확한 시작 및 종료 시간을 예측합니다.
- 신뢰도 점수: 모든 단어와 세그먼트에 신뢰도 점수를 할당합니다.
- 메모리 효율성: 표준 Whisper 대비 추가 메모리 오버헤드가 최소화되어 긴 오디오 파일을 처리할 수 있도록 설계되었습니다.
- VAD 통합: Silero, Auditok를 통해 음성 활동 탐지(VAD)를 지원하여 침묵 기간 동안의 환각을 방지합니다.
- 다국어 지원:
openai-whisper의 모든 버전과 호환되며, Hugging Face Hub의 파인튜닝 모델도 지원합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch