resemble-ai/chatterbox

SoTA open-source TTS

何を解決するか

Chatterbox は、テキストから自然で会話的な音声を生成するためのオープンソースの音声合成(TTS)モデルのファミリーを提供します。高性能GPUからリソース制約のあるCPUまで、さまざまなハードウェア制約下での高品質なボイスクラウンニングと多言語音声生成のニーズに対応しています。

動作方法

このプロジェクトは、さまざまな用途に合わせた複数のモデルバリアントを提供しています:

  • Chatterbox-Turbo:3.5億パラメータのモデルで、低遅延のボイスエージェントに最適化されており、生成ステップを10ステップから1ステップに削減する蒸留デコーダーを搭載しています。
  • Chatterbox-Nano:Turboアーキテクチャの1.1億パラメータ版で、デバイス内およびCPU推論に最適化されており、8コアCPU上でリアルタイムの3倍の速度で実行可能です。
  • Chatterbox-Multilingual V3:5億パラメータの汎用モデルで、23言語以上をサポートし、スピーカーの類似性が向上し、幻覚が減少しています。
  • 単一言語パック:中国語、ヒンディー語、スペイン語など優先言語向けの専用ファインチューニングにより、品質管理を厳密に保ち、地域方言の正確性を高めています。

すべてのモデルは、リファレンス音声クリップを用いたゼロショットボイスクラウンニングをサポートし、責任あるAI利用のため、Perthシステムによる不可視のニューラルウォーターマーキングを内蔵しています。

対象ユーザー

  • ボイスエージェント開発者:インタラクティブなアプリケーションに低遅延・高忠実度の音声が必要な方。
  • ローカリゼーション専門家:幅広い言語間で安定したボイスクラウンニングを必要とするユーザー。
  • エッジデバイス開発者:CPUやメモリ・VRAM制約の厳しいデバイスにTTSを展開する方。
  • コンテンツクリエイター:[laugh] や [cough] のようなパラリンギスティックタグを使ってナレーションにリアリズムを加えたい方。

特徴

  • 多様なモデルズー:1.1億~5億パラメータの選択肢で、速度と品質のバランスを調整可能。
  • ネイティブなパラリンギスティック対応:笑い声やくすくす笑いなどの非言語的サインを音声に挿入可能。
  • 広範な多言語対応:23言語以上をサポートし、高精度のための専用単一言語ファインチューニングあり。
  • CPU最適化:Nanoモデルにより、効率的なデバイス内推論が可能。
  • 責任あるAI:生成音声を検出可能な統合ニューラルウォーターマーキングを搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト