andimarafioti/faster-qwen3-tts

Real-time text-to-speech with Qwen3-TTS

解决的问题

Faster Qwen3-TTS 解决了标准 Qwen3-TTS 模型的高延迟和推理速度慢的问题。它支持实时文本转语音生成,显著降低首次音频输出时间(TTFA),并提升流式与非流式音频生成的实时因子(RTF)。

工作原理

该项目通过使用 torch.cuda.CUDAGraph 捕获执行图来优化推理,无需依赖 Flash Attention、vLLM 或 Triton 等复杂依赖。支持两种主要后端:

  • Torch/CUDA-graph:NVIDIA GPU 的默认高性能路径。
  • GGMLqwentts.cpp 运行时的实验性适配器,支持量化推理。

为在流式传输中保持音频质量,采用滑动窗口机制,使用 25 帧的左文本来解码音频块,避免边界伪影。在上下文学习(ICL)模式下,还会自动在参考音频末尾添加静音,防止生成语音起始处的音素泄漏。

适用人群

  • 构建实时 AI 语音应用的开发者。
  • 希望在 NVIDIA GPU(包括 Jetson AGX Orin)上以极低延迟运行 Qwen3-TTS 的用户。
  • 寻求 OpenAI 兼容 TTS API 以集成到 OpenWebUI 等工具中的用户。

核心亮点

  • 显著提速:在多种 NVIDIA GPU 上实现最高 9.8x 的 RTF 提升和 6.5x 的 TTFA 降低。
  • 灵活生成模式:支持通过 x-vector 或 ICL 实现语音克隆、预设说话人 ID(CustomVoice),以及基于指令的语音设计。
  • 流式支持:生成过程中输出音频块,支持即时播放。
  • OpenAI 兼容:内置遵循 POST /v1/audio/speech 协议的 API 服务器。
  • 多后端支持:提供原生 PyTorch 路径和实验性 GGML 后端。

相关