wildminder/ComfyUI-VoxCPM

ComfyUI node for highly expressive speech and realistic zero-shot voice cloning

解決的問題

ComfyUI-VoxCPM 為 VoxCPM 系統提供了視覺化介面,使用戶無需編寫程式碼即可生成富有表現力的高品質語音並進行高級語音克隆。它簡化了模型管理、音訊處理以及透過 LoRA 進行語音微調的過程。

工作原理

該專案將無需分詞器的 VoxCPM 模型(基於 MiniCPM-4 骨幹網路)作為一組自定義節點整合到 ComfyUI 中。它支援兩個主要模型版本:

  • VoxCPM2:支援語音設計(根據文本描述創建語音)、參考克隆(使用音訊進行身份識別)以及「終極克隆」(結合來自不同來源的身份與韻律)。
  • VoxCPM1.5:專注於零樣本(zero-shot)TTS,並支援原生 LoRA 訓練與推理。

使用者可以連接用於 TTS 生成、語音克隆配置以及高級擴散參數(如 temperature 與 CFG)的節點,以控制輸出音訊的品質與表現力。

適用對象

使用 ComfyUI 並希望生成專業級合成語音、克隆特定聲音或透過自然語言描述設計自定義聲音的內容創作者、音訊工程師與 AI 研究人員。

亮點

  • 高級克隆模式:提供零樣本、基於參考的克隆以及「終極克隆」(身份 + 韻律)。
  • 語音設計:使用自然語言提示詞(例如「溫暖的女聲」)生成新聲音。
  • 多語言支援:VoxCPM2 支援 30 多種語言,輸出頻率為 48kHz。
  • LoRA 整合:包含用於訓練自定義 LoRA 模型與執行推理的內建節點。
  • 自動化管理:在 ComfyUI 環境中端到端地處理模型下載與記憶體管理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案