SonyResearch/Woosh

Public release of the Sound Effect Foundation model by Sony AI.

何を解決するか

Wooshは、高品質なサウンドエフェクトを生成するための生成モデルのセットです。テキスト記述に基づく音声生成(テキストから音声)またはビデオシーケンスと同期する音声生成(ビデオから音声)の課題に対処します。

動作方法

このプロジェクトは、Latent Diffusion Models (LDMs) と補助コンポーネントのセットを使用しています:

  • Woosh-AE:生の音声と潜在表現の間の変換を処理する音声エンコーダ/デコーダ。
  • Woosh-CLAP:マルチモーダルなアライメントモデルで、拡散モデルの条件付けに使用するテキスト-音声トークン潜在を提供します。
  • Woosh-Flow と Woosh-DFlow:テキストプロンプトから音声を生成するか、条件なしで生成するモデル。
  • Woosh-VFlow:ビデオシーケンスに特化して音声を生成するマルチモーダルLDMで、オプションのテキストプロンプトも使用可能。

対象ユーザー

このツールキットは、メディア制作における自動サウンドエフェクト生成に関心を持つサウンドデザイナー、ビデオエディター、AI研究者を対象としています。

特徴

  • テキストから音声 (T2A):文章による記述からサウンドエフェクトを生成。
  • ビデオから音声 (V2A):ビデオの視覚的コンテンツに合った音声を生成。
  • マルチモーダル条件付け:ビデオとテキストプロンプトを組み合わせて音声生成が可能。
  • オープンウェイト:公開データセット用の事前学習済み重みが利用可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト