Stability-AI/stable-audio-metrics

Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.

何を解決するか

長時間のフルバンドステレオ音声に特化した音楽および音声生成モデルの品質を評価するための標準化された方法を提供します。リサンプリングやモノラル/ステレオ変換を自動的に処理することで、異なるモデル間の公平な比較を保証します。

動作方法

このプロジェクトは、既存のモデルに基づく3つの主要な評価指標を実装しています:

  • フリューゲン距離(48kHz):OpenL3 を使用
  • カルバック・ライブラー(KL)ダイバージェンス(32kHz):PaSST を使用
  • CLAPスコア(48kHz):CLAP-LAION を使用

これらの指標は長さが異なる音声ファイルを処理でき、効率性を高めるためにGPUで実行されるように設計されています。

対象ユーザー

MusicCaps、AudioCaps、Song Describerなどのベンチマークと比較して、生成音声および音楽AIモデルの出力品質を定量的に測定したい研究者や開発者。

特徴

  • 標準化されたベンチマーク: MusicCaps、AudioCaps、Song Describer データセットに対する評価をサポート。
  • 柔軟な入力: 長さが異なる音声入力を扱い、ステレオ/モノラルの差異を自動で処理。
  • 事前計算された統計情報: 事前計算された参照統計情報と埋め込みを使用する「no-audio」例を含み、評価を高速化。
  • GPU最適化: CPU処理の遅延を回避するため、GPU実行を特に設計。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch