dbccccccc/ttsfm

TTSFM mirrors OpenAI's TTS service, providing a compatible interface for text-to-speech conversion with multiple voice options for free.

해결하는 문제

TTSFM은 텍스트를 자연스러운 음성으로 변환하기 위한 무료 OpenAI 호환 API 서비스를 제공합니다. 이는 openai.fm 백엔드로 연결되는 브리지 역할을 하여, 사용자가 OpenAI의 공식 유료 서비스를 직접 사용하지 않고도 고품질 텍스트 음성 변환(TTS) 기능을 애플리케이션에 통합할 수 있도록 합니다.

작동 방식

이 프로젝트는 openai.fm 서비스의 리버스 엔지니어링 구현체입니다. OpenAI의 TTS 엔드포인트를 모방한 RESTful API, 동기 및 비동기 요청을 위한 Python SDK, 그리고 실시간 스트리밍을 위한 WebSocket을 제공합니다. 속도 조절(0.25x ~ 4.0x) 및 6가지 다양한 오디오 형식 간의 변환과 같은 고급 오디오 처리를 위해 전체 Docker 이미지 버전에서는 ffmpeg를 사용합니다.

대상 사용자

프로젝트에 OpenAI 호환 TTS 인터페이스가 필요한 개발자 및 연구자, Docker를 통해 TTS 서버를 간단하게 배포하려는 사용자, 또는 Python 라이브러리를 사용하여 텍스트에서 음성을 생성하려는 사용자에게 적합합니다.

주요 특징

  • OpenAI 호환성: OpenAI의 TTS API를 대체하여 바로 사용할 수 있습니다.
  • 광범위한 오디오 옵션: 11가지의 다양한 목소리와 6가지 오디오 형식(MP3, WAV, OPUS, AAC, FLAC, PCM)을 지원합니다.
  • 긴 텍스트 처리: 어떤 길이의 콘텐츠에 대해서도 오디오를 자동으로 분할하고 결합합니다.
  • 유연한 배포: 고급 기능을 위한 전체 Docker 이미지와 기본 기능을 위한 슬림 이미지를 모두 제공합니다.
  • 통합 도구: 테스트 및 실험을 위한 웹 플레이그라운드와 Python SDK가 포함되어 있습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트