chenpipi0807/ComfyUI-Index-TTS
使用IndexTTS模型在ComfyUI中实现高质量文本到语音转换的自定义节点。支持中文和英文文本,可以基于参考音频复刻声音特征。
解决的问题
该项目为 ComfyUI 提供了一组自定义节点,实现高保真文本转语音(TTS)转换。用户可从一段短参考音频中克隆语音特征,并对语言、语速和情感进行精确控制,解决了在节点化工作流中创建自然、多语言且富有情感表达的合成语音的难题。
工作原理
该项目将 IndexTTS 系列模型(1.5、2 和 2.5 版本)实现为 ComfyUI 节点。通过参考音频文件提取说话人嵌入,并结合输入文本进行语音合成。
关键技术机制包括:
- 多模型支持:集成 IndexTTS-2.5、2 和 1.5。
- 情感控制:三种情感引导方式:使用参考情感音频片段、调整 8 维情感向量(如快乐、愤怒、悲伤),或提供情感的文本描述(由 Qwen 情感模型驱动)。
- 发音控制:在 2.5 版本中,用户可直接在文本中插入特定音标标记(中文用拼音,英文用 CMU 音素,日文用片假名)以纠正发音。
- 小说解析:专用的「小说文本结构」节点,可自动识别故事中的角色与叙述者,并为不同角色分配不同声音。
- 音频清理:集成的 Audio Cleaner 节点,用于去除输出中的混响和噪声。
适用人群
- 内容创作者:制作有声书、播客或视频,需要一致且高质量语音克隆的人。
- ComfyUI 用户:AI 艺术家和开发者,希望在生成流程中集成专业级 TTS 的人。
- 故事讲述者:希望为小说或剧本生成多角色对话的用户。
核心亮点
- 跨语言克隆:使用中文参考音频生成英文、日文、西班牙文或阿拉伯文语音(IndexTTS-2.5)。
- 精确速度控制:原生支持
duration_factor调整语速,不牺牲音质。 - 多角色支持:专用节点用于解析小说文本,支持最多五位不同角色声音及一位叙述者。
- 灵活情感调节:支持基于向量的滑块与自然语言情感描述两种方式。
- uma 内存管理:提供 Cache Control 节点,可切换模型是否常驻内存,以管理 VRAM 使用量。
相关
- 项目
- 项目
- 项目
- 项目
- 项目