flybirdxx/ComfyUI-Qwen-TTS

A Simple Implementation of Qwen3-TTS's ComfyUI

解決的問題

本專案提供 ComfyUI 自訂節點,支援高保真語音合成、零樣本語音克隆,以及在節點式工作流程中進行語音設計。使用者可從文字生成語音,使用短時間音訊樣本克隆語音,或根據自然語言描述創造全新語音。

工作原理

整合阿里巴巴開源的 Qwen3-TTS 模型,支援 0.6B 與 1.7B 參數模型。系統採用多種注意力機制(如 SAGE、Flash Attention 2 與 SDPA)以優化推論速度與記憶體使用。提供一系列專用節點,用於不同任務:

  • 語音設計:透過文字描述生成語音。
  • 語音克隆:從參考音訊中克隆語音。
  • 自訂語音:使用預設講者。
  • 對話推論:管理多角色腳本並合成複雜對話。
  • 角色庫與語音克隆提示:提取並儲存語音特徵,供後續生成重複使用。

適用對象

本工具專為希望在生成式 AI 工作流程中整合專業級語音合成的 ComfyUI 使用者設計,適用於製作有聲書、角色扮演情境或以角色為主的創作內容。

核心亮點

  • 零樣本克隆:僅需 5–15 秒的參考音訊片段即可完成語音克隆。
  • 語音設計:透過自然語言提示生成獨特語音特徵。
  • 多語言支援:原生支援 10 種語言,包括英語、中文、日語、韓語、德語、法語、俄語、葡萄牙語、西班牙語與義大利語。
  • 靈活記憶體管理:支援生成後從 GPU 記憶體卸載模型,適用於 VRAM 小於 8GB 的使用者。
  • 優化推論效能:支援多種注意力實作方式,顯著提升推論速度。
  • 多角色對話:提供專用節點,用於管理多個講者並合成連續對話腳本。

相關

  • 專案
  • 專案
  • 專案
  • 專案