wildminder/ComfyUI-VoxCPM

ComfyUI node for highly expressive speech and realistic zero-shot voice cloning

解决的问题

ComfyUI-VoxCPM 为 VoxCPM 系统提供了可视化界面,使用户无需编写代码即可生成富有表现力的高质量语音并进行高级语音克隆。它简化了模型管理、音频处理以及通过 LoRA 进行语音微调的过程。

工作原理

该项目将无需分词器的 VoxCPM 模型(基于 MiniCPM-4 骨干网络)作为一组自定义节点集成到 ComfyUI 中。它支持两个主要模型版本:

  • VoxCPM2:支持语音设计(根据文本描述创建语音)、参考克隆(使用音频进行身份识别)以及“终极克隆”(结合来自不同来源的身份和韵律)。
  • VoxCPM1.5:专注于零样本(zero-shot)TTS,并支持原生 LoRA 训练和推理。

用户可以连接用于 TTS 生成、语音克隆配置以及高级扩散参数(如 temperature 和 CFG)的节点,以控制输出音频的质量和表现力。

适用对象

使用 ComfyUI 并希望生成专业级合成语音、克隆特定声音或通过自然语言描述设计自定义声音的内容创作者、音频工程师和 AI 研究人员。

亮点

  • 高级克隆模式:提供零样本、基于参考的克隆以及“终极克隆”(身份 + 韵律)。
  • 语音设计:使用自然语言提示词(例如“温暖的女声”)生成新声音。
  • 多语言支持:VoxCPM2 支持 30 多种语言,输出频率为 48kHz。
  • LoRA 集成:包含用于训练自定义 LoRA 模型和执行推理的内置节点。
  • 自动化管理:在 ComfyUI 环境中端到端地处理模型下载和内存管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目