Stability-AI/stable-audio-metrics
Metrics for evaluating music and audio generative models – with a focus on long-form, full-band, and stereo generations.
해결하는 문제
음악 및 음성 생성 모델의 품질을 평가하는 표준화된 방법을 제공하며, 특히 장시간, 전체 대역폭 스테레오 오디오에 초점을 맞춥니다. 리샘플링 및 모노/스테레오 변환을 자동으로 처리하여 서로 다른 모델 간의 공정한 비교를 보장합니다.
작동 방식
이 프로젝트는 기존 모델을 기반으로 한 세 가지 주요 평가 지표를 구현합니다:
- 프레셰 거리 (48kHz) – OpenL3 사용
- 컬백-라이블러 (KL) 발산 (32kHz) – PaSST 사용
- CLAP 점수 (48kHz) – CLAP-LAION 사용
이 지표들은 길이가 다른 오디오 파일을 처리할 수 있으며, 효율성을 위해 GPU에서 실행되도록 설계되었습니다.
대상 사용자
MusicCaps, AudioCaps, Song Describer와 같은 벤치마크와 비교하여 생성 음성 및 음악 AI 모델의 출력 품질을 정량적으로 측정하고자 하는 연구자 및 개발자.
주요 특징
- 표준화된 벤치마킹: MusicCaps, AudioCaps, Song Describer 데이터셋에 대한 평가를 지원합니다.
- 유연한 입력: 길이가 다른 오디오 입력을 처리하고 스테레오/모노 차이를 자동으로 관리합니다.
- 사전 계산된 통계: 사전 계산된 참조 통계 및 임베딩을 사용하는 "no-audio" 예제를 포함하여 평가 속도를 향상시킵니다.
- GPU 최적화: 느린 CPU 처리를 피하기 위해 GPU 실행을 특별히 설계되었습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch