KittenML/KittenTTS

State-of-the-art TTS model under 25MB 😻

解決する課題

Kitten TTS は、軽量でオープンソースのテキスト読み上げ (TTS) ライブラリを提供し、GPU を必要とせずに高品質な音声合成を CPU 上で効率的に実行できるようにします。エッジデプロイメントやローカル環境における、高速でフットプリントの小さい音声生成のニーズに対応します。

仕組み

ONNX runtime 上に構築されたこのライブラリは、パフォーマンスとサイズのバランスを取るために、いくつかのモデルバリアント(15Mから80Mのパラメータ)を提供します。数字、通貨、単位を処理するための組み込みのテキスト前処理パイプラインが含まれており、24 kHz のサンプリングレートで音声を出力します。ユーザーは8つの組み込み音声から選択し、シンプルな API を通じて音声速度を調整できます。

対象者

限られたハードウェア、エッジデバイス、または GPU アクセラレーションが利用できないシステム上で実行する必要があるアプリケーションに、音声合成を統合したい開発者。

ハイライト

  • 超軽量: ディスク上のモデルサイズは 25 MB から 80 MB の範囲です。
  • CPU 最適化: GPU なしで効率的な推論のために ONNX を使用します。
  • 組み込み音声: 8種類の個別の音声(例: Bella、Jasper、Luna)が含まれています。
  • テキスト正規化: 略語、日付、通貨を展開するための統合パイプライン。
  • 柔軟なデプロイメント: CPU と CUDA バックエンドの両方をサポートします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト