PierrunoYT/Kokoro-TTS-Local
A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.
해결하는 문제
Kokoro-TTS-Local은 Kokoro-82M 텍스트 음성 변환 모델의 간소화된 로컬 구현을 제공합니다. Hugging Face에서 모델 및 음성을 자동으로 다운로드하고 고품질 음성을 오프라인으로 생성하기 위한 사용하기 쉬운 인터페이스를 제공하여 복잡한 수동 설정의 필요성을 제거합니다.
작동 방식
이 프로젝트는 Kokoro-82M 모델(82M 파라미터 모델)을 래핑하여 다음과 같은 여러 상호작용 방법을 제공합니다:
- 인터페이스: 텍스트 입력 및 음성 선택을 위한 대화형 명령줄 인터페이스(CLI)와 Gradio 기반 웹 인터페이스를 제공합니다.
- 에셋 관리: 모델 파일 (
kokoro-v1_0.pth) 및 설정 파일의 다운로드를 자동으로 처리합니다. 또한HF_HUB_OFFLINE환경 변수를 통한 전용 오프라인 모드도 지원합니다. - 처리: 시스템은 미국 및 영국 영어, 일본어, 중국어(Mandarin) 등을 포함하여 9개 언어에 걸쳐 54개의 음성을 지원합니다. 오디오는 WAV, MP3, AAC 형식으로 출력할 수 있습니다.
- 하드웨어 가속: 더 빠른 생성을 위해 CUDA 호환 GPU를 지원하며, CPU에서도 작동합니다.
대상 사용자
장치 내 클라우드 API에 의존하지 않고, 개인 정보 보호, 오프라인 액세스 또는 다른 로컬 AI 워크플로에 통합하기 위해 자신의 하드웨어에서 고품질 텍스트 음성 합성을 로컬로 실행하고자 하는 사용자.
주요 특징
- 다국어 지원: 9개 언어에 걸친 54개의 음성.
- 오프라인 기능: 초기 에셋 다운로드 후 완전한 오프라인 모드 지원.
- 사용자 친화적 인터페이스: 웹 UI와 CLI 모두 포함.
- 포괄적인 진단: Python 버전, CUDA 가용성 및 종속성을 검증하기 위한 내장된
kokoro-tts-check도구. - 유연한 출력: 다양한 오디오 형식(WAV, MP3, AAC) 및 조절 가능한 음성 속도(0.5x ~ 2.0x) 지원.
- Docker 지원: CPU 기반 설정을 위한 Docker를 통한 빠른 시작.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트