remsky/Kokoro-FastAPI

Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI

何を解決するか

Kokoro-FastAPI は、高品質な音声合成を簡素化し、数分で数時間分の音声を生成できる、高性能で Docker 化された API ラッパーです。OpenAI 互換インターフェースを提供することで、既存のアプリケーションへの容易な統合を実現します。

動作方法

このプロジェクトは Kokoro-82M モデルを FastAPI サーバーでラップし、テキストから音声へのリクエストを処理するエンドポイントを公開しています。CPU、NVIDIA GPU(CUDA)、AMD GPU(ROCm)、Apple Silicon(MPS)など複数のハードウェアバックエンドをサポートしています。テキスト処理、ボイスミキシング、MP3、WAV、Opus、FLAC、AAC、PCM などのさまざまなフォーマットへのオーディオエンコードを処理し、ストリーミングまたは最終的なオーディオファイルを返却します。

対象ユーザー

  • 開発者:セルフホスト型で OpenAI 互換の TTS API を探している人。
  • コンテンツクリエイター:長編コンテンツ用に高速で高品質なボイス生成が必要な人。
  • AIアプリケーション開発者:複数のスピーカー間の会話や複雑な音声制御をソフトウェアに統合したい人。

特徴

  • OpenAI 互換性:標準的な Speech エンドポイントを使用し、シームレスな統合を実現。
  • 多言語対応:英語(米国/英国)、スペイン語、フランス語、ヒンディー語、イタリア語、日本語、ブラジルポルトガル語、中国語(普通話)をサポート。
  • 高度なボイス制御:複数のボイスを重み付きでミキシング、ボイスエイリアス、タグによるインラインスピーカー切り替えを実現。
  • 細かいテキスト制御:一時停止、IPA発音、話す速度をインライントークンで制御可能。実験的な SSML 対応もサポート。
  • 高性能:最初のトークンの遅延を低減するストリーミングサポートと、幅広いハードウェアアクセラレーションを提供。
  • 詳細な出力:単語単位またはチャンク単位のタイムスタンプ付きキャプションを生成可能。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト