jasonppy/VoiceCraft

Zero-Shot Speech Editing and Text-to-Speech in the Wild

何を解決するか

VoiceCraftは、ポッドキャスト、オーディオブック、インターネット動画などの「野生の」データ(in-the-wild data)を使用して、高品質なゼロショット音声編集および音声合成(TTS)を行うことの難しさに対処します。数秒の参照音声だけで、未見の声をクローン可能であり、テキストから新しい音声を生成したり、既存の音声記録を変更したりする能力を持っています。

動作方法

VoiceCraftはトークン補完ニューラルコーデック言語モデルです。音声をトークンのシーケンス(Encodecを使用)として扱い、テキストのトランスクリプトと参照音声プロンプトに基づいて、音声トークンの欠落部分を「補完」する言語モデルアプローチを採用しています。このアーキテクチャにより、TTS(音声を完全から生成)と音声編集(既存の音声クリップの特定部分を置き換えまたは変更)の両方に対応できます。

対象ユーザー

  • オーディオエンジニアおよびコンテンツクリエイター:元の話者による再録音が不要な音声編集に最適。
  • AI研究者:ニューラルコーデック言語モデルやゼロショット声クローンに興味がある方。
  • 開発者:スタンドアロンスクリプトまたはDocker経由で高品質なTTSおよび音声編集をアプリケーションに統合したい方。

特徴

  • ゼロショット声クローン:数秒の参照音声だけで未見の声をクローン可能。
  • 二重機能性:テキストから音声を生成する機能と音声編集機能の両方をサポート。
  • 野生のデータでのパフォーマンス:オーディオブックやポッドキャストを含む多様なリアルワールド音声データで訓練済み。
  • 柔軟なデプロイ:Google Colab、Docker、スタンドアロンPythonスクリプトなど、複数の方法で推論を実行可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト