remsky/Kokoro-FastAPI

Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI

해결하는 문제

Kokoro-FastAPI는 고성능의 Docker 기반 API 래퍼로, Kokoro-82M 텍스트 음성 변환(TTS) 모델을 쉽게 배포할 수 있도록 도와줍니다. 수분 내에 수 시간 분량의 오디오를 생성할 수 있으며, 기존 애플리케이션에 쉽게 통합할 수 있는 OpenAI 호환 인터페이스를 제공합니다.

작동 방식

이 프로젝트는 Kokoro-82M 모델을 FastAPI 서버로 감싸며, 텍스트에서 음성으로의 요청을 처리하는 엔드포인트를 노출합니다. CPU, NVIDIA GPU(CUDA), AMD GPU(ROCm), Apple Silicon(MPS) 등 다양한 하드웨어 백엔드를 지원합니다. 텍스트 처리, 음성 믹싱, MP3, WAV, Opus, FLAC, AAC, PCM 등의 다양한 포맷으로 오디오 인코딩을 처리한 후 스트리밍하거나 최종 오디오 파일을 반환합니다.

대상 사용자

  • 개발자: 자체 호스팅 가능한 OpenAI 호환 TTS API를 찾는 사람.
  • 콘텐츠 제작자: 긴 형식의 콘텐츠용으로 빠르고 고품질의 음성 생성이 필요한 사람.
  • AI 애플리케이션 개발자: 소프트웨어에 다중 스피커 대화나 복잡한 음성 제어를 통합하고자 하는 사람.

주요 특징

  • OpenAI 호환성: 표준 Speech 엔드포인트를 사용하여 원활한 통합을 가능하게 합니다.
  • 다국어 지원: 영어(미국/영국), 스페인어, 프랑스어, 힌디어, 이탈리아어, 일본어, 브라질 포르투갈어, 중국어(간체)를 지원합니다.
  • 고급 음성 제어: 여러 음성의 가중치 기반 믹싱, 음성 별칭, 태그를 통한 인라인 스피커 전환 기능을 제공합니다.
  • 세밀한 텍스트 제어: 일시정지, IPA 발음, 말하는 속도를 인라인 토큰으로 제어할 수 있으며, 실험적인 SSML 지원도 제공합니다.
  • 고성능: 첫 번째 토큰 지연을 줄이기 위한 스트리밍 지원과 다양한 하드웨어 가속을 지원합니다.
  • 세부 출력: 단어 단위 또는 청크 단위의 타임스탬프가 포함된 자막을 생성할 수 있습니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트