inworld-ai/tts

Inworld TTS

何を解決するか

このプロジェクトは、高品質なテキストから音声への変換(TTS)システムを作成するために必要な学習およびモデリングインフラを提供します。開発者は、独自の音声データを使用してSpeechLMベースのモデルの事前学習、微調整、またはアライメントを実行でき、単一GPU環境から大規模なマルチGPUクラスタまでをサポートします。

動作方法

このシステムは、1D音声コード化器と組み合わせたSpeechLMアーキテクチャを使用して、テキストを音声に変換します。ワークフローは以下の通りです:

  1. データ準備:生の音声と字幕を特定のJSONL形式に処理します。
  2. ベクトル化:エンコーダ(xcodec2と互換性あり)を使用して音声を音声コードに変換します。
  3. SFT学習:教師あり微調整(SFT)により、モデルがテキストに条件付けられた音声コードを生成するように学習させます。
  4. RLHFアライメント:人間からのフィードバックを用いた強化学習(RLHF)により、報酬関数(例:単語誤り率)を使用してモデルをさらに最適化し、人間の好みに一致させます。
  5. 推論:学習済みモデル、エンコーダ、デコーダを用いて、テキスト入力と音声プロンプトから音声を生成します。

対象ユーザー

カスタムのテキストから音声への変換モデルを構築するAI研究者やエンジニアで、分散学習(DDP、DeepSpeed、FSDP)およびRLHFアライメントをサポートするスケーラブルな学習パイプラインが必要な方。

特徴

  • 分散学習:DDP、DeepSpeed、FSDPをネイティブでサポートし、複数GPUにスケーリング可能。
  • RLHF統合:報酬関数を用いたアライメントと、学習中の高速生成にvLLMを活用する機能を内蔵。
  • 柔軟なモデリング:任意のSpeechLMモデルをサポートし、xcodec2のチェックポイントとも互換性があります。
  • 包括的なパイプライン:データのベクトル化、シャードのマージ、サービング用モデル変換のための即時利用可能なスクリプトを含む。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト