AudioLLMs/AudioBench

AudioBench: A Universal Benchmark for Audio Large Language Models

解决的问题

AudioBench 为评估音频大语言模型 (AudioLLMs) 提供了一个标准化的通用基准测试。它解决了缺乏综合评估框架的问题,该框架无法在包括语音识别、音频场景理解和语音特征在内的多种音频任务中对模型进行测试。

工作原理

该框架允许用户在广泛的音频数据集上运行推理,并使用不同的指标评估结果。它支持“以模型作为评委 (model-as-judge)”的方法,通过 vLLM 提供强大的 LLM(如 Llama-3-70B)来对被测试模型的回答进行评分。它还支持用于 ASR 和翻译任务的传统指标,如字错率 (WER) 和 BLEU。

适用对象

专为正在构建或微调 AudioLLMs 的 AI 研究人员和开发人员设计,他们需要衡量模型在语音、音乐和环境音频理解方面的性能。

亮点

  • 广泛的数据集支持:涵盖超过 50 个数据集,跨越 ASR、语音翻译、问答、情感识别和音乐理解。
  • 多样化的任务覆盖:评估语音、音频场景和语音理解的能力。
  • Model-as-Judge 集成:内置支持使用 LLM 来评估开放式回答。
  • 可扩展的架构:向基准测试套件添加新的自定义数据集和模型的简单流程。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目