flybirdxx/ComfyUI-Qwen-TTS

A Simple Implementation of Qwen3-TTS's ComfyUI

解决的问题

本项目提供 ComfyUI 自定义节点,支持高保真语音合成、零样本语音克隆以及在节点化工作流中进行语音设计。用户可从文本生成语音,使用短音频样本克隆声音,或基于自然语言描述创建全新语音。

工作原理

集成阿里巴巴开源的 Qwen3-TTS 模型,支持 0.6B 和 1.7B 参数模型。系统采用多种注意力机制(如 SAGE、Flash Attention 2 和 SDPA)优化推理速度与内存占用。提供一系列专用节点,用于不同任务:

  • 语音设计:通过文本描述生成语音。
  • 语音克隆:从参考音频中克隆语音。
  • 自定义语音:使用预设说话人。
  • 对话推理:管理多角色脚本并合成复杂对话。
  • 角色库与语音克隆提示:提取并保存语音特征,供后续生成复用。

适用人群

本工具专为希望在生成式 AI 工作流中集成专业级语音合成的 ComfyUI 用户设计,适用于制作有声书、角色扮演场景或以角色为核心的创作内容。

核心亮点

  • 零样本克隆:仅需 5–15 秒的参考音频片段即可完成语音克隆。
  • 语音设计:通过自然语言提示生成独特语音特征。
  • 多语言支持:原生支持 10 种语言,包括英语、中文、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。
  • 灵活内存管理:支持生成后从 GPU 内存卸载模型,适用于 VRAM 小于 8GB 的用户。
  • 优化推理性能:支持多种注意力实现方式,显著提升推理速度。
  • 多角色对话:提供专用节点,用于管理多个说话人并合成连续对话脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目