devnen/Chatterbox-TTS-Server

Self-host the powerful Chatterbox TTS model. This server offers a user-friendly Web UI, flexible API endpoints (incl. OpenAI compatible), predefined voices, voice cloning, and large audiobook-scale text processing. Runs accelerated on NVIDIA (CUDA), AMD (ROCm), and CPU.

解決する課題

Chatterbox TTS Serverは、Resemble AIのChatterboxテキスト読み上げ(TTS)ファミリーをセルフホストするためのユーザーフレンドリーな方法を提供します。これらのモデルのデプロイと使用を簡素化し、モダンなWeb UIとOpenAI互換APIを追加することで、複雑な手動設定なしに高品質な音声生成を可能にします。

仕組み

このプロジェクトは、chatterbox-ttsエンジンをFastAPIサーバーでラップしたものです。3つの異なるモデルをサポートしています:高品質なOriginal Chatterbox(英語)、Chatterbox Multilingual(23言語)、およびChatterbox-Turbo(軽量・高速モデル)。ユーザーはUI上のホットスワップ可能なセレクターを介して、これらのエンジンを切り替えることができます。サーバーはNVIDIA、AMD、Apple Silicon GPUのハードウェアアクセラレーションに対応しており、長いテキストを管理可能な断片に分割して、シームレスなオーディオブックや長尺のナレーションを生成するインテリジェントなチャンキングシステムを備えています。

対象ユーザー

音声エージェントを構築する開発者、オーディオブックを制作するクリエイター、そして音声クローニングと多言語サポートを備えた表現力豊かなセルフホスト型TTSシステムを求めるユーザー。

ハイライト

  • マルチエンジンサポート: サーバーを再起動することなく、Original、Multilingual、Turboモデルをホットスワップ可能。
  • 表現力豊かな音声制御: Chatterbox-Turboは、自然な反応を実現するために [laugh][cough][chuckle] といったパラ言語タグをサポートしています。
  • オーディオブック生成: インテリジェントなテキストチャンキングにより、書籍全体を単一のオーディオファイルとして処理できます。
  • 幅広いハードウェア互換性: CUDA、ROCm、Apple MPSをネイティブサポート。システムへのPythonインストールを必要としないポータブルなWindowsモードも含まれます。
  • OpenAI互換API: 既存のAIワークフローやアプリケーションへの容易な統合が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト