Stability-AI/stable-audio-metrics

Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.

解決的問題

提供一種標準化的方法來評估音樂與音訊生成模型的品質,特別聚焦於長時間、全頻段立體聲音訊。透過自動處理重取樣與單聲道/立體聲轉換,確保不同模型之間的公平比較。

如何運作

本專案實作了三種基於既有模型的主要評估指標:

  • 弗雷歇距離(48kHz)使用 OpenL3
  • Kullback–Leibler(KL)散度(32kHz)使用 PaSST
  • CLAP 分數(48kHz)使用 CLAP-LAION

這些指標可處理長度可變的音訊檔案,並專為 GPU 執行設計,以提升效率。

適用對象

需要將生成音訊與音樂 AI 模型的輸出品質與 MusicCaps、AudioCaps 及 Song Describer 等基準進行定量比較的研究人員與開發者。

主要亮點

  • 標準化基準測試:支援對 MusicCaps、AudioCaps 及 Song Describer 資料集進行評估。
  • 彈性輸入:可處理長度可變的音訊輸入,並自動管理立體聲/單聲道差異。
  • 預先計算的統計資料:包含使用預先計算的參考統計與嵌入的「無音訊」範例,以加速評估。
  • GPU 優化:特別設計為 GPU 執行,避免緩慢的 CPU 處理。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • Dispatch