MisoLabsAI/MisoTTS
Miso TTS is an 8 billion, highly emotive text-to-speech model
解決する課題
Miso TTS 8Bは、高品質な会話形式の英語音声生成のために設計されています。ユーザーはテキストを自然な対話に変換でき、既存の音声を使用してボイスクローニングを行うことも可能です。
仕組み
このモデルは、Sesame CSMアーキテクチャに触発されたRVQ Transformerアーキテクチャを採用しています。主に2つのコンポーネントで構成されています:
- テキストとオーディオフレームの埋め込みを処理する、大規模なLlama 3.2スタイルのバックボーン(8Bパラメータ)。
- 各フレーム内の高次オーディオコードブックを予測する、より小規模な自己回帰型オーディオデコーダー(300Mパラメータ)。
Mimiオーディオトークナイザーを利用し、テキストとオプションのオーディオコンテキストからオーディオコードを生成するため、会話の履歴を維持した、より自然な音声生成が可能です。
対象者
会話形式の対話とボイスクローニングが可能な高忠実度テキスト読み上げシステムを必要とし、かつ高VRAM GPU(例:bfloat16精度には24GB以上のVRAM)を利用可能な開発者および研究者。
ハイライト
- 会話重視: 単なる読み上げではなく、対話生成に特化して設計されています。
- ボイスクローニング: 既存の音声サンプルを条件付けすることで、プロンプトによる生成をサポートします。
- ウォーターマーキング: 安全性と真正性のために、デフォルトのウォーターマーキングが含まれています。
- Llamaベースのアーキテクチャ: 大規模なTransformerバックボーンを活用し、高品質な出力を実現します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト