andimarafioti/faster-qwen3-tts
Real-time text-to-speech with Qwen3-TTS
解決的問題
Faster Qwen3-TTS 解決了標準 Qwen3-TTS 模型的高延遲與推論速度慢的問題。支援即時文字轉語音生成,大幅降低首段音訊輸出時間(TTFA),並提升串流與非串流音訊生成的即時因子(RTF)。
工作原理
本專案透過使用 torch.cuda.CUDAGraph 捕獲執行圖來優化推論,無需依賴 Flash Attention、vLLM 或 Triton 等複雜相依性。支援兩種主要後端:
- Torch/CUDA-graph:NVIDIA GPU 的預設高性能路徑。
- GGML:
qwentts.cpp執行時的實驗性適配器,支援量化推論。
為在串流傳輸中維持音訊品質,採用滑動視窗機制,使用 25 幀的左側上下文來解碼音訊區塊,避免邊界偽影。在上下文學習(ICL)模式下,也會自動在參考音訊末尾加入靜音,防止生成語音起始處的音素洩漏。
適用對象
- 建構即時 AI 語音應用的開發者。
- 希望在 NVIDIA GPU(包含 Jetson AGX Orin)上以極低延遲運行 Qwen3-TTS 的使用者。
- 尋求 OpenAI 相容 TTS API 以整合至 OpenWebUI 等工具的使用者。
核心亮點
- 顯著提速:在多種 NVIDIA GPU 上實現最高 9.8x 的 RTF 提升與 6.5x 的 TTFA 降低。
- 靈活生成模式:支援透過 x-vector 或 ICL 實現語音克隆、預設說話人 ID(CustomVoice),以及指令式語音設計。
- 串流支援:生成過程中輸出音訊區塊,支援即時播放。
- OpenAI 相容:內建遵循
POST /v1/audio/speech協定的 API 伺服器。 - 多後端支援:提供原生 PyTorch 路徑與實驗性 GGML 後端。
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- Dispatch