QwenAudio/CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
解決する課題
CosyVoiceは、テキストから自然で一貫性があり、制御可能な音声を生成するという課題に対処します。特に、現実世界のシナリオにおける様々な方言、感情、複雑なテキスト形式を処理できる、高品質なゼロショット多言語音声合成のニーズをターゲットとしています。
仕組み
大規模言語モデル(LLM)に基づき、本システムは教師ありセマンティックトークンを使用して音声を合成します。テキスト入力と音声出力のバイストリーミングをサポートしており、150msという低レイテンシを実現しています。フレームワークには、音素の読み上げインペインティング、特殊記号のテキスト正規化、言語・方言・感情・速度・音量を制御するための指示サポートなどの機能が含まれています。
対象者
音声合成に取り組む開発者や研究者、低レイテンシを必要とするプロダクションレベルのオーディオアプリケーション、および高度に制御可能な多言語ボイスクローニングを必要とするユーザー向けに設計されています。
ハイライト
- 多言語・方言サポート: 9つの一般的な言語と18以上の中国語の方言をカバー。
- ゼロショット・ボイスクローニング: 特定の話し手の事前学習なしに、言語横断的および多言語のボイスクローニングが可能。
- 高いパフォーマンス: 最先端のコンテンツ一貫性、話者類似性、および韻律の自然さを実現。
- 低レイテンシ: 150msという低レイテンシのストリーミング推論をサポート。
- 制御性: 発音インペインティング、および感情や速度に関する様々な指示をサポート。