KittenML/KittenTTS

State-of-the-art TTS model under 25MB 😻

해결하는 문제

Kitten TTS는 GPU 없이도 CPU에서 고품질 음성 합성을 효율적으로 실행할 수 있는 가벼운 오픈 소스 텍스트 음성 변환(TTS) 라이브러리를 제공합니다. 엣지 배포 및 로컬 환경을 위한 빠르고 저용량 오디오 생성의 필요성을 해결합니다.

작동 방식

ONNX runtime 기반으로 구축된 이 라이브러리는 성능과 크기의 균형을 맞추기 위해 여러 모델 변형(15M ~ 80M 매개변수)을 제공합니다. 숫자, 통화 및 단위를 처리하는 기본 제공 텍스트 전처리 파이프라인이 포함되어 있으며, 24 kHz 샘플링 레이트로 오디오를 출력합니다. 사용자는 8개의 기본 제공 음성 중에서 선택하고 간단한 API를 통해 음성 속도를 조정할 수 있습니다.

대상 사용자

제한된 하드웨어, 엣지 기기 또는 GPU 가속을 사용할 수 없는 시스템에서 실행되어야 하는 애플리케이션에 음성 합성을 통합하려는 개발자.

하이라이트

  • 초경량: 디스크상의 모델 크기는 25 MB에서 80 MB 범위입니다.
  • CPU 최적화: GPU 없이 효율적인 추론을 위해 ONNX를 사용합니다.
  • 기본 제공 음성: 8가지의 고유한 음성(예: Bella, Jasper, Luna)이 포함되어 있습니다.
  • 텍스트 정규화: 약어, 날짜 및 통화를 확장하기 위한 통합 파이프라인.
  • 유연한 배포: CPU 및 CUDA 백엔드를 모두 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트