KoljaB/RealtimeTTS

Converts text to speech in realtime

解决的问题

RealtimeTTS 解决了文本转语音(TTS)系统通常存在的高延迟问题,特别适用于需要将字符串、生成器或实时 LLM 令牌流转换为音频的应用程序。它提供了一个统一的接口,用于处理流式音频播放和引擎管理的复杂性。

工作原理

该库作为大量 TTS 引擎的包装器,允许开发者将文本输入到一个流中,该流可以本地播放、流式传输到其他进程,或保存为 WAV 文件。它支持同步和异步播放,并能处理通过迭代器传入的分块文本,以确保音频尽可能快地开始播放。它还包含句子分割逻辑,以优化语音的流畅性。

适用人群

专为开发对话式 AI、语音助手或任何需要从动态文本源实现低延迟、高质量语音合成的应用程序的开发者设计。

主要亮点

  • 广泛的引擎支持:集成本地神经模型(如 QwenEngine 和 Coqui)、云 API(OpenAI、Azure、Elevenlabs)以及系统语音。
  • 低延迟:针对快速的「首个令牌时间」(TTFT)和最小可听启动延迟进行了优化,特别是使用推荐的 QwenEngine 时。
  • 灵活的输出:支持本地扬声器播放、WAV 文件导出,以及适用于生产环境的无头 HTTP 服务器模式。
  • 高级控制功能:包含语音克隆、可靠性保障的备用引擎,以及用于单词时序和音频块的详细回调。
  • LLM 集成:专门设计用于处理来自 LLM 的令牌流,以最小化文本生成与语音之间的延迟差距。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目