VOICEVOX/voicevox_engine
無料で使える中品質なテキスト読み上げソフトウェア、VOICEVOXの音声合成エンジン
解决的问题
VOICEVOX ENGINE 通过 HTTP 服务器提供了一种执行文本转语音(TTS)合成的方法。它允许用户和开发者从文本生成高质量的合成语音,调整发音和语调,并将这些功能集成到其他应用程序中,而无需从头构建 TTS 引擎。
工作原理
该项目作为一个 HTTP 服务器运行,提供一组用于语音合成的 API。该过程通常分为两个步骤:首先发送 /audio_query 请求以生成合成查询(包含速度和语调等参数),然后使用该查询发送 /synthesis 请求以生成最终的 .wav 音频文件。它支持 CPU 和 GPU 加速(通过 NVIDIA),并可通过 Docker 部署。
适用人群
- 终端用户:希望为内容创作生成合成语音的人
- 开发者:希望通过 API 将 VOICEVOX 语音合成集成到自己软件中的人
- 引擎创建者:希望构建可在 VOICEVOX 编辑器中使用的 VOICEVOX 兼容引擎的人
主要亮点
- 灵活控制:使用自定义标记法(AquesTalk 风格)调整语音速度、语调和发音。
- 用户词典:完全支持通过 API 添加、编辑和删除自定义词汇,以提高发音准确性。
- 高级合成:包含语音混音(混合两种不同声音)和歌唱语音合成(使用基于 MIDI 的乐谱)等功能。
- 开发者友好:提供 Docker 镜像以简化设置,配备全面的 API 文档,并支持多引擎实例(多引擎功能)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目