SonyResearch/Woosh
Public release of the Sound Effect Foundation model by Sony AI.
解决的问题
Woosh 提供了一组生成模型,旨在创建高质量的音效。它解决了基于文本描述生成音频(文本到音频)或与视频序列同步生成音频(视频到音频)的挑战。
工作原理
该项目使用一系列潜在扩散模型(LDMs)及配套组件:
- Woosh-AE:音频编码器/解码器,负责处理原始音频与潜在表示之间的转换。
- Woosh-CLAP:多模态对齐模型,为扩散模型提供文本-音频标记潜在表示以进行条件控制。
- Woosh-Flow 和 Woosh-DFlow:从文本提示生成音频或无条件生成音频的模型。
- Woosh-VFlow:一种多模态 LDM,可为特定视频序列生成音频,支持可选的文本提示。
适用人群
该工具包适用于对媒体制作中自动化音效生成感兴趣的音效设计师、视频编辑者和 AI 研究人员。
主要亮点
- 文本到音频 (T2A):从文字描述生成音效。
- 视频到音频 (V2A):生成与视频视觉内容匹配的音频。
- 多模态条件控制:可结合视频和文本提示进行音频生成。
- 开放权重:提供公开数据集的预训练权重。
相关
- 项目
- 项目
- 项目
- 项目