SonyResearch/Woosh
Public release of the Sound Effect Foundation model by Sony AI.
解決的問題
Woosh 提供一組生成模型,專為創造高品質音效而設計。它解決了根據文字描述生成音訊(文字到音訊)或與影片序列同步生成音訊(影片到音訊)的挑戰。
工作原理
本專案使用一系列潛在擴散模型(LDMs)及支援元件:
- Woosh-AE:音訊編碼器/解碼器,負責處理原始音訊與潛在表示之間的轉換。
- Woosh-CLAP:多模態對齊模型,為擴散模型提供文字-音訊標記潛在表示以進行條件控制。
- Woosh-Flow 和 Woosh-DFlow:從文字提示生成音訊或無條件生成音訊的模型。
- Woosh-VFlow:一種多模態 LDM,可針對特定影片序列生成音訊,並支援可選的文字提示。
適用對象
此工具包適用於對媒體製作中自動化音效生成感興趣的音效設計師、影片編輯者與 AI 研究人員。
主要亮點
- 文字到音訊 (T2A):從文字描述生成音效。
- 影片到音訊 (V2A):生成與影片視覺內容相符的音訊。
- 多模態條件控制:可結合影片與文字提示進行音訊生成。
- 開放權重:提供公開資料集的預訓練權重。
相關
- 專案
- 專案
- 專案
- 專案