wildminder/ComfyUI-VoxCPM

ComfyUI node for highly expressive speech and realistic zero-shot voice cloning

解決する課題

ComfyUI-VoxCPMは、VoxCPMシステムのビジュアルインターフェースを提供し、コードを書くことなく、表現力豊かで高品質な音声を生成し、高度なボイスクローニングを実行できるようにします。モデルの管理、オーディオ処理、LoRAによる音声の微調整のプロセスを簡素化します。

仕組み

このプロジェクトは、トークナイザー不要のVoxCPMモデル(MiniCPM-4バックボーンに基づく)を、一連のカスタムノードとしてComfyUIに統合します。主に2つのモデルバージョンをサポートしています:

  • VoxCPM2: 音声設計(テキスト記述からの音声作成)、リファレンスクローニング(音声を使用してアイデンティティを再現)、および「究極のクローニング」(異なるソースからアイデンティティと韻律を組み合わせる)をサポートします。
  • VoxCPM1.5: ゼロショットTTSに焦点を当て、ネイティブなLoRAトレーニングと推論をサポートします。

ユーザーは、TTS生成、ボイスクローニング設定、および高度な拡散パラメータ(temperatureやCFGなど)のノードを接続して、出力される音声の品質と表現力を制御できます。

対象者

ComfyUIを使用しており、プロフェッショナルグレードの合成音声を生成したり、特定の音声をクローンしたり、自然言語の記述からカスタム音声を設計したりすることを目的としているコンテンツクリエイター、オーディオエンジニア、AI研究者。

ハイライト

  • 高度なクローニングモード: ゼロショット、リファレンスベース、および「究極のクローニング」(アイデンティティ + 韻律)を提供します。
  • 音声設計: 自然言語のプロンプト(例:「温かみのある女性の声」)を使用して新しい音声を生成します。
  • 多言語サポート: VoxCPM2は48kHzの出力で30以上の言語をサポートしています。
  • LoRA統合: カスタムLoRAモデルのトレーニングと推論の両方を行うための組み込みノードが含まれています。
  • 自動管理: ComfyUI環境内で、モデルのダウンロードからメモリ管理までエンドツーエンドで処理します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト