PierrunoYT/Kokoro-TTS-Local

A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.

해결하는 문제

Kokoro-TTS-Local은 Kokoro-82M 텍스트 음성 변환 모델의 간소화된 로컬 구현을 제공합니다. Hugging Face에서 모델 및 음성을 자동으로 다운로드하고 고품질 음성을 오프라인으로 생성하기 위한 사용하기 쉬운 인터페이스를 제공하여 복잡한 수동 설정의 필요성을 제거합니다.

작동 방식

이 프로젝트는 Kokoro-82M 모델(82M 파라미터 모델)을 래핑하여 다음과 같은 여러 상호작용 방법을 제공합니다:

  • 인터페이스: 텍스트 입력 및 음성 선택을 위한 대화형 명령줄 인터페이스(CLI)와 Gradio 기반 웹 인터페이스를 제공합니다.
  • 에셋 관리: 모델 파일 (kokoro-v1_0.pth) 및 설정 파일의 다운로드를 자동으로 처리합니다. 또한 HF_HUB_OFFLINE 환경 변수를 통한 전용 오프라인 모드도 지원합니다.
  • 처리: 시스템은 미국 및 영국 영어, 일본어, 중국어(Mandarin) 등을 포함하여 9개 언어에 걸쳐 54개의 음성을 지원합니다. 오디오는 WAV, MP3, AAC 형식으로 출력할 수 있습니다.
  • 하드웨어 가속: 더 빠른 생성을 위해 CUDA 호환 GPU를 지원하며, CPU에서도 작동합니다.

대상 사용자

장치 내 클라우드 API에 의존하지 않고, 개인 정보 보호, 오프라인 액세스 또는 다른 로컬 AI 워크플로에 통합하기 위해 자신의 하드웨어에서 고품질 텍스트 음성 합성을 로컬로 실행하고자 하는 사용자.

주요 특징

  • 다국어 지원: 9개 언어에 걸친 54개의 음성.
  • 오프라인 기능: 초기 에셋 다운로드 후 완전한 오프라인 모드 지원.
  • 사용자 친화적 인터페이스: 웹 UI와 CLI 모두 포함.
  • 포괄적인 진단: Python 버전, CUDA 가용성 및 종속성을 검증하기 위한 내장된 kokoro-tts-check 도구.
  • 유연한 출력: 다양한 오디오 형식(WAV, MP3, AAC) 및 조절 가능한 음성 속도(0.5x ~ 2.0x) 지원.
  • Docker 지원: CPU 기반 설정을 위한 Docker를 통한 빠른 시작.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트