readbeyond/aeneas

aeneas is a Python/C library and a set of tools to automagically synchronize audio and text (aka forced alignment)

해결하는 문제

aeneas는 텍스트 파일(조각 목록 포함)과 해당 텍스트를 독백하는 오디오 파일을 자동으로 동기화하는 "강제 정렬(forced alignment)" 문제를 해결하도록 설계되었습니다. 이를 통해 사용자는 오디오 녹음에서 각 텍스트 조각이 언제 발화되었는지 정확한 타임스탬프로 매핑할 수 있습니다.

작동 방식

이 도구는 eSpeak, AWS Polly, Nuance 등의 Text-to-Speech(TTS) 엔진을 활용하여 텍스트의 참조 오디오를 합성합니다. 그 후 MFCC(Mel-frequency cepstral coefficients)와 DTW(Dynamic Time Warping)를 사용하여 합성된 오디오와 실제 독백을 비교하여 각 텍스트 조각에 대한 정확한 시간 간격을 결정합니다.

대상 사용자

주로 연구자, 디지털 출판자(예: EPUB 3용), 자막(SRT, VTT) 제작자가 단어 수준에서부터 전체 단락 수준까지 다양한 세부 수준에서 텍스트와 오디오를 동기화해야 하는 경우에 적합합니다.

주요 특징

  • 다양한 포맷 지원: JSON, SRT, VTT, SMIL, TextGrid 등 다양한 포맷으로 동기화 맵 출력 가능.
  • 다국어 지원: 38개 이상의 언어에서 정상 작동이 확인됨.
  • 유연한 세부 수준: 단어 수준에서부터 단락 수준까지 동기화 가능.
  • 강건성: 배경 잡음, 간헐적 피크, 미세한 발음 오류에 대해 강건하게 설계됨.
  • 배치 처리: 작업 컨테이너를 통해 여러 오디오/텍스트 쌍을 동시에 처리 가능.
  • 통합성: 여러 TTS 엔진용 래퍼 포함 및 YouTube에서 오디오 다운로드 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트