dbccccccc/ttsfm
TTSFM mirrors OpenAI's TTS service, providing a compatible interface for text-to-speech conversion with multiple voice options for free.
解決する課題
TTSFM は、テキストを自然な音声に変換するための、無料の OpenAI 互換 API サービスを提供します。これは openai.fm バックエンドへのブリッジとして機能し、ユーザーが OpenAI の公式有料サービスを直接使用することなく、高品質なテキスト読み上げ (TTS) 機能をアプリケーションに統合できるようにします。
仕組み
このプロジェクトは、openai.fm サービスのリバースエンジニアリングによる実装です。OpenAI の TTS エンドポイントを模倣した RESTful API、同期および非同期リクエスト用の Python SDK、そしてリアルタイムストリーミング用の WebSocket を提供します。速度調整 (0.25x から 4.0x) や 6 つの異なるオーディオ形式間の変換などの高度なオーディオ処理を処理するために、フル Docker イメージ版では ffmpeg を利用しています。
対象者
プロジェクトに OpenAI 互換の TTS インターフェースを必要とする開発者や研究者、および Docker を介して TTS サーバーを簡単にデプロイしたいユーザー、あるいは Python ライブラリを使用してテキストから音声を生成したいユーザーに適しています。
ハイライト
- OpenAI 互換性: OpenAI の TTS API の代わりとしてそのまま使用可能です。
- 豊富なオーディオオプション: 11 種類の異なる音声と 6 つのオーディオ形式 (MP3, WAV, OPUS, AAC, FLAC, PCM) をサポートしています。
- 長文テキストの処理: あらゆる長さのコンテンツに対して、音声を自動的に分割および結合します。
- 柔軟なデプロイ: 高度な機能のためのフル Docker イメージと、基本機能のためのスリムなイメージの両方を提供しています。
- 統合ツール: テストと実験用の Web プレイグラウンドと Python SDK が含まれています。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト