netease-youdao/EmotiVoice

EmotiVoice 😊: a Multi-Voice and Prompt-Controlled TTS Engine

解決的問題

EmotiVoice 解決了標準文字轉語音(TTS)系統中情感表達不足與語音多樣性缺乏的問題。它允許使用者生成自然流暢的英語與中文語音,並可精確控制情感(例如快樂、悲傷或憤怒)與說話者身分。

工作原理

該引擎基於 PromptTTS 的提示控制架構,使用者可透過指定說話者與情感/風格提示來引導語音合成。支援超過 2,000 種不同語音,可透過 Web 界面、腳本介面進行批次處理,或透過 OpenAI 相容 HTTP API 部署。同時支援使用個人資料進行語音克隆。

適用對象

本工具專為需要高品質、富有情感表達的合成語音之應用開發者與創作者設計,也適合希望自訂語音身分或克隆自己語音的使用者。

主要亮點

  • 情感合成:可生成包含特定情感(如快樂、興奮、悲傷、憤怒)的語音。
  • 海量語音庫:可存取超過 2,000 種不同的語音。
  • 雙語支援:全面支援英語與中文。
  • 靈活部署:提供 Docker 鏡像、獨立 Mac 應用或 OpenAI 相容 API 三種方式。
  • 語音克隆:支援使用個人資料訓練模型,實現特定語音的克隆。

相關

  • 專案
  • 專案
  • 專案
  • 專案