diodiogod/TTS-Audio-Suite
A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (classic and multilingual), F5-TTS, Higgs Audio 2, 3, and VibeVoice with unlimited text length, SRT timing, Character support, and many audio tools
它解决了什么问题
TTS Audio Suite 是一个全面的 ComfyUI 扩展,将大量文本转语音(TTS)、语音转换(VC)和自动语音识别(ASR)引擎整合到一个模块化界面中。它通过提供一个集中式平台来解决音频 AI 工具的碎片化问题,支持高质量语音合成、语音克隆以及字幕同步的音频生成,同时通过运行时隔离管理不同 AI 模型的复杂依赖关系。
它如何工作
该套件将 19 种不同的引擎(包括 F5-TTS、Higgs Audio、MOSS-TTS 和 RVC)集成到 ComfyUI 节点中。它采用模块化架构,允许现代引擎在主 Transformers 5 环境中运行,同时将脆弱的旧版堆栈隔离在专用运行时中,以防止依赖冲突。在字幕处理方面,它会解析 SRT 文件以生成同步音频,使用「smart_natural」时间逻辑避免重叠,确保语音自然流畅。
适合谁使用
专为 ComfyUI 用户、内容创作者和动画师设计,适用于需要专业级配音、精确字幕时间对齐、语音克隆或在节点式工作流中实现自动转录与音频编辑的场景。
主要亮点
- 强大的引擎支持:集成 19 种引擎,覆盖数百种语言的 TTS、语音转换和 ASR。
- SRT 集成:提供专用节点,可从 SRT 文件生成带精确时间对齐和分段缓存的 TTS。
- 运行时隔离:通过分离现代与旧版模型环境,防止依赖死锁。
- 高级音频工具:包含基于提示的视觉标签构建器、基于口型动作的无声语音分析器,以及集成的 RVC 模型训练功能。
- 语音设计:支持使用兼容引擎(如 Qwen3-TTS 和 OmniVoice)创建可重复使用的语音。
一个真正统一的音频 AI 工具集,让语音合成、克隆和字幕同步变得前所未有的简单。— @username
相关
- 项目
- 项目
- 项目
- 项目
- 项目