Stability-AI/stable-audio-metrics
Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.
解決的問題
提供一種標準化的方法來評估音樂與音訊生成模型的品質,特別聚焦於長時間、全頻段立體聲音訊。透過自動處理重取樣與單聲道/立體聲轉換,確保不同模型之間的公平比較。
如何運作
本專案實作了三種基於既有模型的主要評估指標:
- 弗雷歇距離(48kHz)使用 OpenL3
- Kullback–Leibler(KL)散度(32kHz)使用 PaSST
- CLAP 分數(48kHz)使用 CLAP-LAION
這些指標可處理長度可變的音訊檔案,並專為 GPU 執行設計,以提升效率。
適用對象
需要將生成音訊與音樂 AI 模型的輸出品質與 MusicCaps、AudioCaps 及 Song Describer 等基準進行定量比較的研究人員與開發者。
主要亮點
- 標準化基準測試:支援對 MusicCaps、AudioCaps 及 Song Describer 資料集進行評估。
- 彈性輸入:可處理長度可變的音訊輸入,並自動管理立體聲/單聲道差異。
- 預先計算的統計資料:包含使用預先計算的參考統計與嵌入的「無音訊」範例,以加速評估。
- GPU 優化:特別設計為 GPU 執行,避免緩慢的 CPU 處理。
相關
- 專案
- Dispatch
- 專案
- 專案
- Dispatch