OpenBMB/VoxCPM
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
何を解決するか
VoxCPMは、従来のTTSにおける離散トークン化の制限を克服し、非常に自然で表現豊かなスタジオ品質の音声を生成する、トークン化不要の音声合成システムです。多言語音声生成、クリエイティブなボイスデザイン、高精細なボイスクラウンニングを可能にします。
動作方法
このシステムは、MiniCPM-4を基盤としたエンドツーエンドの拡散自己回帰アーキテクチャを使用しています。離散トークンではなく、連続的な音声表現を直接生成します。最新バージョンのVoxCPM2は、200万時間以上の多言語音声データで訓練された20億パラメータのモデルです。AudioVAE V2を用いた非対称なエンコード/デコード設計により、16kHzの参照音声から直接48kHzの音声を出力し、内蔵のスーパーレゾリューション機能を備えています。
対象ユーザー
- コンテンツクリエイター: ビデオやポッドキャスト用に高品質な多言語音声合成が必要な方。
- 開発者: 実時間ストリーミング、ボイスクラウンディング、カスタムボイスデザインを必要とするAI音声アプリケーションを開発する方。
- 企業: 商用利用可能なオープンソースTTSソリューション(Apache-2.0ライセンス)を探している企業。
主な特徴
- 30言語対応: 言語タグを必要とせず、30の異なる言語およびさまざまな中国語方言の音声合成が可能。
- ボイスデザイン: 参照音声なしで、自然言語による記述(例:年齢、性別、トーン)に基づいて新しいボイスを生成。
- 制御可能なボイスクラウンディング: 短い音声クリップからトーンをクラウンディングしつつ、感情や速度のスタイルガイドを指定可能。
- 究極のクラウンディング: 参照音声とそのトランスクリプトの両方を使用して、リズムやスタイルを含むすべての声のニュアンスを再現。
- スタジオ品質の音声: 内蔵のスーパーレゾリューションにより、直接48kHzの音声を出力。
- 高パフォーマンス: Nano-vLLMまたはvLLM-Omniで加速すると、NVIDIA RTX 4090でRTFが0.13まで低下し、リアルタイムストリーミングに対応。
- デプロイの柔軟性: Python API、CLI、およびllama.cpp-omniなどの高性能C++推論エンジンを介して、デバイス内での使用も可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト