andimarafioti/faster-qwen3-tts
Real-time text-to-speech with Qwen3-TTS
解决的问题
Faster Qwen3-TTS 解决了标准 Qwen3-TTS 模型的高延迟和推理速度慢的问题。它支持实时文本转语音生成,显著降低首次音频输出时间(TTFA),并提升流式与非流式音频生成的实时因子(RTF)。
工作原理
该项目通过使用 torch.cuda.CUDAGraph 捕获执行图来优化推理,无需依赖 Flash Attention、vLLM 或 Triton 等复杂依赖。支持两种主要后端:
- Torch/CUDA-graph:NVIDIA GPU 的默认高性能路径。
- GGML:
qwentts.cpp运行时的实验性适配器,支持量化推理。
为在流式传输中保持音频质量,采用滑动窗口机制,使用 25 帧的左文本来解码音频块,避免边界伪影。在上下文学习(ICL)模式下,还会自动在参考音频末尾添加静音,防止生成语音起始处的音素泄漏。
适用人群
- 构建实时 AI 语音应用的开发者。
- 希望在 NVIDIA GPU(包括 Jetson AGX Orin)上以极低延迟运行 Qwen3-TTS 的用户。
- 寻求 OpenAI 兼容 TTS API 以集成到 OpenWebUI 等工具中的用户。
核心亮点
- 显著提速:在多种 NVIDIA GPU 上实现最高 9.8x 的 RTF 提升和 6.5x 的 TTFA 降低。
- 灵活生成模式:支持通过 x-vector 或 ICL 实现语音克隆、预设说话人 ID(CustomVoice),以及基于指令的语音设计。
- 流式支持:生成过程中输出音频块,支持即时播放。
- OpenAI 兼容:内置遵循
POST /v1/audio/speech协议的 API 服务器。 - 多后端支持:提供原生 PyTorch 路径和实验性 GGML 后端。
相关
- 项目
- Dispatch
- Dispatch
- Dispatch
- Dispatch