SonyResearch/Woosh

Public release of the Sound Effect Foundation model by Sony AI.

解決的問題

Woosh 提供一組生成模型,專為創造高品質音效而設計。它解決了根據文字描述生成音訊(文字到音訊)或與影片序列同步生成音訊(影片到音訊)的挑戰。

工作原理

本專案使用一系列潛在擴散模型(LDMs)及支援元件:

  • Woosh-AE:音訊編碼器/解碼器,負責處理原始音訊與潛在表示之間的轉換。
  • Woosh-CLAP:多模態對齊模型,為擴散模型提供文字-音訊標記潛在表示以進行條件控制。
  • Woosh-Flow 和 Woosh-DFlow:從文字提示生成音訊或無條件生成音訊的模型。
  • Woosh-VFlow:一種多模態 LDM,可針對特定影片序列生成音訊,並支援可選的文字提示。

適用對象

此工具包適用於對媒體製作中自動化音效生成感興趣的音效設計師、影片編輯者與 AI 研究人員。

主要亮點

  • 文字到音訊 (T2A):從文字描述生成音效。
  • 影片到音訊 (V2A):生成與影片視覺內容相符的音訊。
  • 多模態條件控制:可結合影片與文字提示進行音訊生成。
  • 開放權重:提供公開資料集的預訓練權重。

相關

  • 專案
  • 專案
  • 專案
  • 專案