kyutai-labs/pocket-tts
A TTS that fits in your CPU (and pocket)
해결하는 문제
Pocket TTS는 비용이 많이 드는 GPU나 외부 웹 API가 필요 없이 가벼운 음성 합성(TTS) 애플리케이션입니다. 사용자는 로컬 CPU에서 텍스트로부터 고품질 오디오를 직접 생성할 수 있으며, 빠르고, 개인 정보 보호가 보장되며, 효율적인 음성 생성 방식을 제공합니다.
작동 방식
이 프로젝트는 CPU 실행에 최적화된 작은 모델(1억 파라미터)을 사용합니다. 오디오 스트리밍과 음성 클론 기능을 지원하며, 짧은 오디오 샘플(wav 파일)을 사용해 음성 임베딩(음성 상태)을 생성하고, 해당 특정 음성으로 음성을 생성하는 데 사용합니다. 영어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 스페인어를 포함한 여러 언어를 지원합니다.
대상 사용자
GPU 하드웨어가 필요 없이 TTS 기능을 애플리케이션에 통합하고자 하는 개발자, 그리고 로컬 음성 생성을 위한 간단한 CLI 또는 웹 인터페이스를 원하는 사용자에게 적합합니다.
주요 특징
- CPU 최적화: CPU에서 효율적으로 작동하며, 맥북 에어 M4에서 2개의 CPU 코어만으로 최대 6배의 실시간 속도를 달성합니다.
- 저지연: 약 200ms 내에 첫 번째 오디오 청크를 제공합니다.
- 음성 클론: 일반 wav 파일이나 사전 계산된 safetensors 임베딩에서 음성을 클론할 수 있습니다.
- 다국어 지원: 6개의 주요 유럽 언어를 지원합니다.
- 유연한 배포: Python API, CLI, 로컬 HTTP 서버를 제공하며, 커뮤니티에서 WebAssembly, Rust, C++, C#으로의 포트도 존재합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트