netease-youdao/EmotiVoice

EmotiVoice 😊: a Multi-Voice and Prompt-Controlled TTS Engine

解决的问题

EmotiVoice 解决了标准文本转语音(TTS)系统中情感表达不足和语音多样性匮乏的问题。它允许用户生成自然流畅的英语和中文语音,且可精确控制情感(如快乐、悲伤或愤怒)和说话人身份。

工作原理

该引擎基于 PromptTTS 的提示控制架构,用户可通过指定说话人和情感/风格提示来引导语音合成。支持超过 2,000 种不同语音,可通过 Web 界面、脚本接口进行批量处理,或通过 OpenAI 兼容 HTTP API 部署。同时支持使用个人数据进行语音克隆。

适用人群

本工具专为需要高质量、富有情感表达的合成语音的应用开发者和创作者设计,也适合希望自定义语音身份或克隆自己声音的用户。

主要亮点

  • 情感合成:可生成包含特定情感(如快乐、兴奋、悲伤、愤怒)的语音。
  • 海量语音库:可访问超过 2,000 种不同的语音。
  • 双语支持:全面支持英语和中文。
  • 灵活部署:提供 Docker 镜像、独立 Mac 应用或 OpenAI 兼容 API 三种方式。
  • 语音克隆:支持使用个人数据训练模型,实现特定语音的克隆。

相关

  • 项目
  • 项目
  • 项目
  • 项目