fishaudio/fish-speech

SOTA Open Source TTS

何を解決するか

Fish Speech は、非常に自然で感情豊かなリアルな発話を生成するように設計された多言語テキストto音声(TTS)システムです。細かい抑揚や感情を捉えつつ、高音質と高速な推論速度を両立する音声生成の課題に対処しています。数十言語にわたる環境で実現されています。

動作方法

このシステムは Dual-Autoregressive (Dual-AR) アーキテクチャを使用しています。大規模な「Slow AR」(4Bパラメータ)が時間軸に沿って主な意味コードブックを予測し、小規模な「Fast AR」(400Mパラメータ)が残差コードブックを生成して音響的詳細を再構築します。モデルは80言語以上で1,000万時間以上の音声データで訓練され、Group Relative Policy Optimization (GRPO) 強化学習により、人間のような音響的好みと音色の類似性を確保しています。

対象ユーザー

最先端の音声クローン、マルチスピーカー会話生成、合成音声に対する正確な感情制御が必要な開発者やクリエイター向けです。

主な特徴

  • 細かいインライン制御: [whisper][excited] など15,000以上のユニークな自然言語タグをサポートし、感情や抑揚をテキストに直接埋め込み可能。
  • 高速音声クローン: 10〜30秒の短い参照サンプルを使用して、追加のファインチューニングなしで音声をクローン可能。
  • 多言語対応: 音素や言語固有の前処理なしに、80言語以上をネイティブにサポート。
  • ネイティブなマルチスピーカー生成: 1つの参照音声ファイルからスピーカーIDトークンを使用して、1回の生成で複数のスピーカーを扱える。
  • 高パフォーマンス: SGLangを介したストリーミング最適化により、初音声までの時間(~100ms)が低く、NVIDIA H200 GPUで高いスループットを実現。
  • マルチターン生成: 前回のターンからのコンテキストを活用し、会話の自然さを向上。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト