OpenBMB/VoxCPM

VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

何を解決するか

VoxCPMは、従来のTTSにおける離散トークン化の制限を克服し、非常に自然で表現豊かなスタジオ品質の音声を生成する、トークン化不要の音声合成システムです。多言語音声生成、クリエイティブなボイスデザイン、高精細なボイスクラウンニングを可能にします。

動作方法

このシステムは、MiniCPM-4を基盤としたエンドツーエンドの拡散自己回帰アーキテクチャを使用しています。離散トークンではなく、連続的な音声表現を直接生成します。最新バージョンのVoxCPM2は、200万時間以上の多言語音声データで訓練された20億パラメータのモデルです。AudioVAE V2を用いた非対称なエンコード/デコード設計により、16kHzの参照音声から直接48kHzの音声を出力し、内蔵のスーパーレゾリューション機能を備えています。

対象ユーザー

  • コンテンツクリエイター: ビデオやポッドキャスト用に高品質な多言語音声合成が必要な方。
  • 開発者: 実時間ストリーミング、ボイスクラウンディング、カスタムボイスデザインを必要とするAI音声アプリケーションを開発する方。
  • 企業: 商用利用可能なオープンソースTTSソリューション(Apache-2.0ライセンス)を探している企業。

主な特徴

  • 30言語対応: 言語タグを必要とせず、30の異なる言語およびさまざまな中国語方言の音声合成が可能。
  • ボイスデザイン: 参照音声なしで、自然言語による記述(例:年齢、性別、トーン)に基づいて新しいボイスを生成。
  • 制御可能なボイスクラウンディング: 短い音声クリップからトーンをクラウンディングしつつ、感情や速度のスタイルガイドを指定可能。
  • 究極のクラウンディング: 参照音声とそのトランスクリプトの両方を使用して、リズムやスタイルを含むすべての声のニュアンスを再現。
  • スタジオ品質の音声: 内蔵のスーパーレゾリューションにより、直接48kHzの音声を出力。
  • 高パフォーマンス: Nano-vLLMまたはvLLM-Omniで加速すると、NVIDIA RTX 4090でRTFが0.13まで低下し、リアルタイムストリーミングに対応。
  • デプロイの柔軟性: Python API、CLI、およびllama.cpp-omniなどの高性能C++推論エンジンを介して、デバイス内での使用も可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト