AudioLLMs/AudioBench
AudioBench: A Universal Benchmark for Audio Large Language Models
해결하는 문제
AudioBench는 오디오 대규모 언어 모델(AudioLLMs)을 평가하기 위한 표준화된 범용 벤치마크를 제공합니다. 이는 음성 인식, 오디오 장면 이해, 음성 특성을 포함한 다양한 오디오 작업에 걸쳐 모델을 테스트할 수 있는 포괄적인 평가 프레임워크가 부족한 문제를 해결합니다.
작동 방식
이 프레임워크를 통해 사용자는 다양한 오디오 데이터셋에서 추론을 실행하고 다양한 지표를 사용하여 결과를 평가할 수 있습니다. 강력한 LLM(Llama-3-70B와 같은)이 vLLM을 통해 제공되어 테스트 중인 모델의 응답을 채점하는 "model-as-judge" 방식을 지원합니다. 또한 ASR 및 번역 작업을 위한 Word Error Rate (WER) 및 BLEU와 같은 전통적인 지표도 지원합니다.
대상
음성, 음악 및 환경 오디오 이해에 걸쳐 모델의 성능을 측정해야 하는 AudioLLMs를 구축하거나 미세 조정하는 AI 연구자 및 개발자를 위해 설계되었습니다.
주요 특징
- 광범위한 데이터셋 지원: ASR, 음성 번역, 질의응답, 감정 인식 및 음악 이해를 아우르는 50개 이상의 데이터셋을 포함합니다.
- 다양한 작업 범위: 음성, 오디오 장면 및 음성 이해 능력을 평가합니다.
- Model-as-Judge 통합: 개방형 응답을 평가하기 위해 LLM을 사용하는 내장 지원 기능을 제공합니다.
- 확장 가능한 아키텍처: 벤치마크 제품군에 새로운 커스텀 데이터셋 및 모델을 추가할 수 있는 간단한 프로세스를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트