flybirdxx/ComfyUI-Qwen-TTS
A Simple Implementation of Qwen3-TTS's ComfyUI
解決的問題
本專案提供 ComfyUI 自訂節點,支援高保真語音合成、零樣本語音克隆,以及在節點式工作流程中進行語音設計。使用者可從文字生成語音,使用短時間音訊樣本克隆語音,或根據自然語言描述創造全新語音。
工作原理
整合阿里巴巴開源的 Qwen3-TTS 模型,支援 0.6B 與 1.7B 參數模型。系統採用多種注意力機制(如 SAGE、Flash Attention 2 與 SDPA)以優化推論速度與記憶體使用。提供一系列專用節點,用於不同任務:
- 語音設計:透過文字描述生成語音。
- 語音克隆:從參考音訊中克隆語音。
- 自訂語音:使用預設講者。
- 對話推論:管理多角色腳本並合成複雜對話。
- 角色庫與語音克隆提示:提取並儲存語音特徵,供後續生成重複使用。
適用對象
本工具專為希望在生成式 AI 工作流程中整合專業級語音合成的 ComfyUI 使用者設計,適用於製作有聲書、角色扮演情境或以角色為主的創作內容。
核心亮點
- 零樣本克隆:僅需 5–15 秒的參考音訊片段即可完成語音克隆。
- 語音設計:透過自然語言提示生成獨特語音特徵。
- 多語言支援:原生支援 10 種語言,包括英語、中文、日語、韓語、德語、法語、俄語、葡萄牙語、西班牙語與義大利語。
- 靈活記憶體管理:支援生成後從 GPU 記憶體卸載模型,適用於 VRAM 小於 8GB 的使用者。
- 優化推論效能:支援多種注意力實作方式,顯著提升推論速度。
- 多角色對話:提供專用節點,用於管理多個講者並合成連續對話腳本。
相關
- 專案
- 專案
- 專案
- 專案