flybirdxx/ComfyUI-Qwen-TTS

A Simple Implementation of Qwen3-TTS's ComfyUI

何を解決するか

このプロジェクトは、高品質な音声合成(TTS)、ゼロショット音声クローン、およびノードベースのワークフロー内での音声設計を可能にするComfyUIカスタムノードを提供します。テキストから音声を生成したり、短い音声サンプルから音声をクローンしたり、自然言語の記述に基づいてまったく新しい音声を作成したりできます。

仕組み

Alibabaが開発したオープンソースのQwen3-TTSモデルを統合しており、0.6Bおよび1.7Bパラメータのモデルをサポートしています。推論速度とメモリ使用量を最適化するために、SAGE、Flash Attention 2、SDPAなどのさまざまなアテンション機構を使用しています。以下の専用ノードを備えています:

  • 音声設計:テキスト記述から音声を生成。
  • 音声クローン:参照音声から音声をクローン。
  • カスタム音声:事前設定されたスピーカーを使用。
  • 会話推論:複数の役割を持つスクリプトを管理し、複雑な会話の合成を行う。
  • 役割バンク & 音声クローンプロンプト:音声特徴を抽出・保存し、異なる生成間で再利用可能にする。

対象ユーザー

このツールは、アudiobookやロールプレイシナリオ、キャラクター中心のコンテンツ制作など、生成AIワークフローにプロフェッショナルな音声合成を統合したいComfyUIユーザー向けに設計されています。

特徴

  • ゼロショットクローン:5~15秒の短い参照クリップのみで音声をクローン可能。
  • 音声設計:自然言語プロンプトを使ってユニークな音声特性を生成。
  • 多言語対応:英語、中国語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語をネイティブサポート。
  • 柔軟なメモリ管理:生成後にモデルをGPUメモリからアンロードするオプションを提供。VRAMが8GB未満のユーザーにも対応。
  • 最適化された推論:複数のアテンション実装をサポートし、大幅な高速化を実現。
  • マルチロール会話:複数の話者を管理し、連続する会話スクリプトを合成する専用ノードを搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト