jasonppy/VoiceCraft
Zero-Shot Speech Editing and Text-to-Speech in the Wild
何を解決するか
VoiceCraftは、ポッドキャスト、オーディオブック、インターネット動画などの「野生の」データ(in-the-wild data)を使用して、高品質なゼロショット音声編集および音声合成(TTS)を行うことの難しさに対処します。数秒の参照音声だけで、未見の声をクローン可能であり、テキストから新しい音声を生成したり、既存の音声記録を変更したりする能力を持っています。
動作方法
VoiceCraftはトークン補完ニューラルコーデック言語モデルです。音声をトークンのシーケンス(Encodecを使用)として扱い、テキストのトランスクリプトと参照音声プロンプトに基づいて、音声トークンの欠落部分を「補完」する言語モデルアプローチを採用しています。このアーキテクチャにより、TTS(音声を完全から生成)と音声編集(既存の音声クリップの特定部分を置き換えまたは変更)の両方に対応できます。
対象ユーザー
- オーディオエンジニアおよびコンテンツクリエイター:元の話者による再録音が不要な音声編集に最適。
- AI研究者:ニューラルコーデック言語モデルやゼロショット声クローンに興味がある方。
- 開発者:スタンドアロンスクリプトまたはDocker経由で高品質なTTSおよび音声編集をアプリケーションに統合したい方。
特徴
- ゼロショット声クローン:数秒の参照音声だけで未見の声をクローン可能。
- 二重機能性:テキストから音声を生成する機能と音声編集機能の両方をサポート。
- 野生のデータでのパフォーマンス:オーディオブックやポッドキャストを含む多様なリアルワールド音声データで訓練済み。
- 柔軟なデプロイ:Google Colab、Docker、スタンドアロンPythonスクリプトなど、複数の方法で推論を実行可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト