CosyVoice: ゼロショット多言語音声合成のための高度なLLMベースのテキスト読み上げシステム
CosyVoice: ゼロショット多言語音声合成のための高度なLLMベースのテキスト読み上げシステム
それが解決する課題
CosyVoiceは、テキストから自然で一貫性があり、制御可能な音声を生成する課題に対処します。特に、さまざまな方言、感情、複雑なテキストフォーマットに対応できる高品質なゼロショット多言語音声合成のニーズをターゲットとしています。
その仕組み
大規模言語モデル(LLM)に基づき、このシステムは教師あり意味トークンを使用して音声を合成します。テキスト入力と音声出力をサポートする双方向ストリーミングにより、150ms以下の低遅延を実現します。フレームワークには、音素の発音インペインティング、特殊記号のテキスト正規化、言語、方言、感情、速度、ボリュームを制御するためのインストラクションサポートなどの機能が含まれます。
対象者
これは、音声合成に従事する開発者や研究者、低遅延を必要とする本番レベルのオーディオアプリケーション、そして高度に制御可能な多言語音声クローンが必要なユーザー向けに設計されています。
ハイライト
- 多言語および方言サポート: 9つの一般的な言語と18以上の中国方言をカバーします。
- ゼロショット音声クローン: 特定の話者への事前トレーニングなしで、クロスリンガルおよびマルチリンガル音声クローンを可能にします。
- 高いパフォーマンス: 最先端のコンテンツ一貫性、話者類似性、韻律の自然性を達成します。
- 低遅延: 150ms以下の遅延でストリーミング推論をサポートします。
- 制御性: 音声のインペインティングおよび感情と速度のためのさまざまな指示をサポートします。