chenpipi0807/ComfyUI-Index-TTS

使用IndexTTS模型在ComfyUI中实现高质量文本到语音转换的自定义节点。支持中文和英文文本,可以基于参考音频复刻声音特征。

解决的问题

该项目为 ComfyUI 提供了一组自定义节点,实现高保真文本转语音(TTS)转换。用户可从一段短参考音频中克隆语音特征,并对语言、语速和情感进行精确控制,解决了在节点化工作流中创建自然、多语言且富有情感表达的合成语音的难题。

工作原理

该项目将 IndexTTS 系列模型(1.5、2 和 2.5 版本)实现为 ComfyUI 节点。通过参考音频文件提取说话人嵌入,并结合输入文本进行语音合成。

关键技术机制包括:

  • 多模型支持:集成 IndexTTS-2.5、2 和 1.5。
  • 情感控制:三种情感引导方式:使用参考情感音频片段、调整 8 维情感向量(如快乐、愤怒、悲伤),或提供情感的文本描述(由 Qwen 情感模型驱动)。
  • 发音控制:在 2.5 版本中,用户可直接在文本中插入特定音标标记(中文用拼音,英文用 CMU 音素,日文用片假名)以纠正发音。
  • 小说解析:专用的「小说文本结构」节点,可自动识别故事中的角色与叙述者,并为不同角色分配不同声音。
  • 音频清理:集成的 Audio Cleaner 节点,用于去除输出中的混响和噪声。

适用人群

  • 内容创作者:制作有声书、播客或视频,需要一致且高质量语音克隆的人。
  • ComfyUI 用户:AI 艺术家和开发者,希望在生成流程中集成专业级 TTS 的人。
  • 故事讲述者:希望为小说或剧本生成多角色对话的用户。

核心亮点

  • 跨语言克隆:使用中文参考音频生成英文、日文、西班牙文或阿拉伯文语音(IndexTTS-2.5)。
  • 精确速度控制:原生支持 duration_factor 调整语速,不牺牲音质。
  • 多角色支持:专用节点用于解析小说文本,支持最多五位不同角色声音及一位叙述者。
  • 灵活情感调节:支持基于向量的滑块与自然语言情感描述两种方式。
  • uma 内存管理:提供 Cache Control 节点,可切换模型是否常驻内存,以管理 VRAM 使用量。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目