Stability-AI/stable-audio-metrics

Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.

解决的问题

提供一种标准化的方法来评估音乐和音频生成模型的质量,特别关注长时长、全频段立体声音频。通过自动处理重采样和单声道/立体声转换,确保不同模型之间的公平比较。

工作原理

该项目实现了基于现有模型的三种主要评估指标:

  • 弗雷chet距离(48kHz)使用 OpenL3
  • Kullback–Leibler(KL)散度(32kHz)使用 PaSST
  • CLAP分数(48kHz)使用 CLAP-LAION

这些指标可处理长度可变的音频文件,并专为GPU执行而设计,以提高效率。

适用对象

需要将生成音频和音乐AI模型的输出质量与 MusicCaps、AudioCaps 和 Song Describer 等基准进行定量比较的研究人员和开发者。

主要亮点

  • 标准化基准测试:支持对 MusicCaps、AudioCaps 和 Song Describer 数据集进行评估。
  • 灵活输入:可处理长度可变的音频输入,并自动管理立体声/单声道差异。
  • 预计算统计信息:包含使用预计算参考统计和嵌入的「无音频」示例,以加快评估速度。
  • GPU优化:专为GPU执行设计,避免缓慢的CPU处理。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • Dispatch