KoljaB/RealtimeTTS
Converts text to speech in realtime
解决的问题
RealtimeTTS 解决了文本转语音(TTS)系统通常存在的高延迟问题,特别适用于需要将字符串、生成器或实时 LLM 令牌流转换为音频的应用程序。它提供了一个统一的接口,用于处理流式音频播放和引擎管理的复杂性。
工作原理
该库作为大量 TTS 引擎的包装器,允许开发者将文本输入到一个流中,该流可以本地播放、流式传输到其他进程,或保存为 WAV 文件。它支持同步和异步播放,并能处理通过迭代器传入的分块文本,以确保音频尽可能快地开始播放。它还包含句子分割逻辑,以优化语音的流畅性。
适用人群
专为开发对话式 AI、语音助手或任何需要从动态文本源实现低延迟、高质量语音合成的应用程序的开发者设计。
主要亮点
- 广泛的引擎支持:集成本地神经模型(如 QwenEngine 和 Coqui)、云 API(OpenAI、Azure、Elevenlabs)以及系统语音。
- 低延迟:针对快速的「首个令牌时间」(TTFT)和最小可听启动延迟进行了优化,特别是使用推荐的 QwenEngine 时。
- 灵活的输出:支持本地扬声器播放、WAV 文件导出,以及适用于生产环境的无头 HTTP 服务器模式。
- 高级控制功能:包含语音克隆、可靠性保障的备用引擎,以及用于单词时序和音频块的详细回调。
- LLM 集成:专门设计用于处理来自 LLM 的令牌流,以最小化文本生成与语音之间的延迟差距。
相关
- 项目
- 项目
- 项目
- 项目
- 项目