Stability-AI/stable-audio-metrics
Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.
解决的问题
提供一种标准化的方法来评估音乐和音频生成模型的质量,特别关注长时长、全频段立体声音频。通过自动处理重采样和单声道/立体声转换,确保不同模型之间的公平比较。
工作原理
该项目实现了基于现有模型的三种主要评估指标:
- 弗雷chet距离(48kHz)使用 OpenL3
- Kullback–Leibler(KL)散度(32kHz)使用 PaSST
- CLAP分数(48kHz)使用 CLAP-LAION
这些指标可处理长度可变的音频文件,并专为GPU执行而设计,以提高效率。
适用对象
需要将生成音频和音乐AI模型的输出质量与 MusicCaps、AudioCaps 和 Song Describer 等基准进行定量比较的研究人员和开发者。
主要亮点
- 标准化基准测试:支持对 MusicCaps、AudioCaps 和 Song Describer 数据集进行评估。
- 灵活输入:可处理长度可变的音频输入,并自动管理立体声/单声道差异。
- 预计算统计信息:包含使用预计算参考统计和嵌入的「无音频」示例,以加快评估速度。
- GPU优化:专为GPU执行设计,避免缓慢的CPU处理。
相关
- 项目
- Dispatch
- 项目
- 项目
- Dispatch