denizsafak/abogen

Generate audiobooks from EPUBs, PDFs and text with synchronized captions.

해결하는 문제

Abogen은 ePub, PDF, 텍스트 파일, markdown과 같은 긴 문서를 완벽하게 동기화된 자막이 포함된 고품질 오디오북 또는 보이스오버로 변환하도록 설계된 텍스트 음성 변환(TTS) 도구입니다. 자막 타이밍을 맞추거나 TTS 생성을 위해 긴 텍스트를 관리하는 수동 작업을 제거합니다.

작동 방식

이 도구는 자연스러운 음성 합성을 위해 Kokoro-82M 모델을 활용합니다. 안정적인 핵심 기능을 위한 PyQt6 데스크톱 애플리케이션과 고급 기능을 위한 Flask 기반 Web UI라는 두 가지 인터페이스를 제공합니다. 다양한 입력 형식(ePub, PDF, TXT, MD, SRT, ASS, VTT)을 지원하며 WAV, MP3, M4B(챕터 포함)와 같은 다양한 형식으로 오디오를 출력할 수 있습니다.

대상 사용자

오디오북 제작자, 소셜 미디어(Instagram, YouTube, TikTok)용 보이스오버 제작자, 그리고 디지털 읽기 자료를 오디오 형식으로 변환하고자 하는 사용자들을 위한 도구입니다.

주요 특징

  • 멀티 포맷 지원: ePub, PDF, markdown 파일을 처리하며, 전자책을 위한 챕터 인식 처리 기능이 포함되어 있습니다.
  • 커스텀 보이스 믹싱: 보이스 믹서를 통해 서로 다른 음성 모델을 조정 가능한 가중치로 혼합하여 고유한 목소리를 만들 수 있습니다.
  • 유연한 자막 생성: 다양한 자막 스타일(문장, 단어 또는 하이라이트 방식)과 포맷(SRT, ASS)을 제공합니다.
  • Cuda/ROCm 지원: NVIDIA 및 AMD GPU에 최적화되어 빠른 처리 속도를 보장합니다。
  • 고급 Web UI: LLM 기반 텍스트 정규화 및 Audiobookshelf 통합과 같은 추가 기능을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트