SonyResearch/Woosh

Public release of the Sound Effect Foundation model by Sony AI.

解决的问题

Woosh 提供了一组生成模型,旨在创建高质量的音效。它解决了基于文本描述生成音频(文本到音频)或与视频序列同步生成音频(视频到音频)的挑战。

工作原理

该项目使用一系列潜在扩散模型(LDMs)及配套组件:

  • Woosh-AE:音频编码器/解码器,负责处理原始音频与潜在表示之间的转换。
  • Woosh-CLAP:多模态对齐模型,为扩散模型提供文本-音频标记潜在表示以进行条件控制。
  • Woosh-Flow 和 Woosh-DFlow:从文本提示生成音频或无条件生成音频的模型。
  • Woosh-VFlow:一种多模态 LDM,可为特定视频序列生成音频,支持可选的文本提示。

适用人群

该工具包适用于对媒体制作中自动化音效生成感兴趣的音效设计师、视频编辑者和 AI 研究人员。

主要亮点

  • 文本到音频 (T2A):从文字描述生成音效。
  • 视频到音频 (V2A):生成与视频视觉内容匹配的音频。
  • 多模态条件控制:可结合视频和文本提示进行音频生成。
  • 开放权重:提供公开数据集的预训练权重。

相关

  • 项目
  • 项目
  • 项目
  • 项目