netease-youdao/EmotiVoice

EmotiVoice 😊: a Multi-Voice and Prompt-Controlled TTS Engine

해결하는 문제

EmotiVoice는 표준 텍스트 음성 합성(TTS) 시스템에서 감정 표현과 목소리 다양성의 부족을 해결합니다. 사용자는 영어 및 중국어로 자연스러운 음성 발화를 생성할 수 있으며, 기쁨, 슬픔, 분노와 같은 특정 감정과 화자 정체성을 정밀하게 제어할 수 있습니다.

작동 방식

이 엔진은 PromptTTS 기반의 프롬프트 제어 아키텍처를 사용하여, 사용자가 화자와 감정/스타일 프롬프트를 지정함으로써 음성 합성을 안내합니다. 2,000개 이상의 다양한 목소리를 지원하며, 웹 인터페이스, 배치 처리용 스크립트 인터페이스, 또는 OpenAI 호환 HTTP API로 배포할 수 있습니다. 또한 개인 데이터를 사용한 목소리 클론 기능도 제공합니다.

대상 사용자

이 도구는 애플리케이션용 고품질 감정 표현이 가능한 합성 음성 필요 개발자 및 크리에이터, 또는 목소리 정체성을 맞춤화하거나 자신의 목소리를 클론하고자 하는 사용자에게 적합합니다.

주요 특징

  • 감정 합성: 기쁨, 흥분, 슬픔, 분노와 같은 특정 감정을 포함한 음성 생성 가능.
  • 대규모 목소리 라이브러리: 2,000개 이상의 독립된 목소리에 접근 가능.
  • 이중 언어 지원: 영어와 중국어 모두 완전히 지원.
  • 유연한 배포: Docker 이미지, 독립형 Mac 앱, 또는 OpenAI 호환 API로 제공.
  • 목소리 클론: 개인 데이터로 모델을 훈련하여 특정 목소리를 클론 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트