MahmoudAshraf97/ctc-forced-aligner
Text to speech alignment using CTC forced alignment
해결하는 문제
이 프로젝트는 오디오 파일과 해당 텍스트 전사 간의 강제 정렬(forced alignment)을 수행할 수 있는 방법을 제공합니다. 이 과정은 오디오 녹음에서 특정 텍스트 세그먼트(예: 단어, 문자, 문장)가 발화된 정확한 시작 및 종료 타임스탬프를 식별하며, 고품질 음성 코퍼스를 생성하는 데 필수적입니다.
작동 방식
이 도구는 Hugging Face에서 제공하는 사전 학습된 연결주의 시계열 분류(CTC) 모델, 특히 Wav2Vec2, HuBERT, MMS 모델을 활용합니다. 오디오 웨이브폼과 텍스트 전사를 처리하여, 이러한 모델을 사용해 발화된 소리를 작성된 텍스트에 매핑하고, 정확한 타임스탬프를 포함한 구조화된 JSON 형식으로 결과를 출력합니다.
대상 사용자
음성-텍스트 데이터를 다루는 연구자 및 개발자, 언어학자, 자막 제작, 음성 코퍼스 생성, 오디오 분석을 위해 오디오와 텍스트를 동기화해야 하는 모든 사람에게 적합합니다.
주요 특징
- 메모리 효율성: TorchAudio 강제 정렬 API보다 최소 5배 이상 메모리를 절약합니다.
- 광범위한 언어 지원: 영어, 아랍어, 러시아어, 독일어를 포함한 1,100개 이상의 언어를 지원합니다.
- 유연한 세분화 수준: 문장, 단어, 문자 수준에서 정렬이 가능합니다.
- GPU 가속: CUDA를 지원하여 추론 속도를 향상시킵니다.
- 구조화된 출력: 각 세그먼트의 정렬된 텍스트와 정확한 타임스탬프를 포함하는 JSON 파일을 생성합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트