nazdridoy/kokoro-tts
A CLI text-to-speech tool using the Kokoro model, supporting multiple languages, voices (with blending), and various input formats including EPUB books and PDF documents.
해결하는 문제
Kokoro TTS는 텍스트를 고품질이고 자연스러운 음성으로 변환하기 위한 명령줄 인터페이스(CLI)를 제공합니다. EPUB 책, PDF 문서, 텍스트 파일과 같은 장문 콘텐츠를 오디오 파일이나 스트리밍 오디오로 변환하는 과정을 단순화하여 Kokoro 모델을 사용하기 위한 복잡한 설정이 필요 없도록 합니다.
작동 방식
이 도구는 ONNX를 통해 Kokoro 모델을 사용하여 음성 합성을 수행합니다. 표준 입력(stdin)을 통해 다른 프로그램에서 텍스트를 파이프할 수 있으며, 긴 텍스트를 처리하기 위해 자동으로 적절한 세그먼트로 분할합니다. 다양한 언어를 지원하며, 사용자가 다양한 음성에 사용자 정의 가중치를 할당하여 하이브리드 음성을 생성할 수 있습니다.
대상 사용자
GUI(그래픽 사용자 인터페이스)가 필요 없이 문서나 책을 오디오북이나 음성 스트림으로 변환하고자 하는 터미널 기반 워크플로우를 선호하는 사용자에게 적합합니다.
주요 기능
- 문서 지원: .epub, .pdf, .txt 파일을 직접 처리하며, 출력을 챕터 단위로 분할할 수 있습니다.
- 음성 커스터마이징: 다양한 언어를 지원하고, 조정 가능한 가중치로 다양한 음성을 블렌딩할 수 있습니다.
- 유연한 출력: 스트리밍 재생, WAV 및 MP3 형식, 오디오 청크 병합 기능을 제공합니다.
- 하드웨어 가속: GPU 지원을 통해 더 빠른 합성 속도를 제공합니다.
- CLI 통합: stdin을 통해 다른 프로그램에서 파이프를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트