QwenAudio/CosyVoice

Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.

解決する課題

CosyVoiceは、テキストから自然で一貫性があり、制御可能な音声を生成するという課題に対処します。特に、現実世界のシナリオにおける様々な方言、感情、複雑なテキスト形式を処理できる、高品質なゼロショット多言語音声合成のニーズをターゲットとしています。

仕組み

大規模言語モデル(LLM)に基づき、本システムは教師ありセマンティックトークンを使用して音声を合成します。テキスト入力と音声出力のバイストリーミングをサポートしており、150msという低レイテンシを実現しています。フレームワークには、音素の読み上げインペインティング、特殊記号のテキスト正規化、言語・方言・感情・速度・音量を制御するための指示サポートなどの機能が含まれています。

対象者

音声合成に取り組む開発者や研究者、低レイテンシを必要とするプロダクションレベルのオーディオアプリケーション、および高度に制御可能な多言語ボイスクローニングを必要とするユーザー向けに設計されています。

ハイライト

  • 多言語・方言サポート: 9つの一般的な言語と18以上の中国語の方言をカバー。
  • ゼロショット・ボイスクローニング: 特定の話し手の事前学習なしに、言語横断的および多言語のボイスクローニングが可能。
  • 高いパフォーマンス: 最先端のコンテンツ一貫性、話者類似性、および韻律の自然さを実現。
  • 低レイテンシ: 150msという低レイテンシのストリーミング推論をサポート。
  • 制御性: 発音インペインティング、および感情や速度に関する様々な指示をサポート。