andimarafioti/faster-qwen3-tts

Real-time text-to-speech with Qwen3-TTS

解決的問題

Faster Qwen3-TTS 解決了標準 Qwen3-TTS 模型的高延遲與推論速度慢的問題。支援即時文字轉語音生成,大幅降低首段音訊輸出時間(TTFA),並提升串流與非串流音訊生成的即時因子(RTF)。

工作原理

本專案透過使用 torch.cuda.CUDAGraph 捕獲執行圖來優化推論,無需依賴 Flash Attention、vLLM 或 Triton 等複雜相依性。支援兩種主要後端:

  • Torch/CUDA-graph:NVIDIA GPU 的預設高性能路徑。
  • GGMLqwentts.cpp 執行時的實驗性適配器,支援量化推論。

為在串流傳輸中維持音訊品質,採用滑動視窗機制,使用 25 幀的左側上下文來解碼音訊區塊,避免邊界偽影。在上下文學習(ICL)模式下,也會自動在參考音訊末尾加入靜音,防止生成語音起始處的音素洩漏。

適用對象

  • 建構即時 AI 語音應用的開發者。
  • 希望在 NVIDIA GPU(包含 Jetson AGX Orin)上以極低延遲運行 Qwen3-TTS 的使用者。
  • 尋求 OpenAI 相容 TTS API 以整合至 OpenWebUI 等工具的使用者。

核心亮點

  • 顯著提速:在多種 NVIDIA GPU 上實現最高 9.8x 的 RTF 提升與 6.5x 的 TTFA 降低。
  • 靈活生成模式:支援透過 x-vector 或 ICL 實現語音克隆、預設說話人 ID(CustomVoice),以及指令式語音設計。
  • 串流支援:生成過程中輸出音訊區塊,支援即時播放。
  • OpenAI 相容:內建遵循 POST /v1/audio/speech 協定的 API 伺服器。
  • 多後端支援:提供原生 PyTorch 路徑與實驗性 GGML 後端。

相關