MatthewCYM/VoiceBench

[TACL'26] VoiceBench: Benchmarking LLM-Based Voice Assistants

解决的问题

VoiceBench 提供了一个标准化的框架和数据集,用于对基于大语言模型(LLM)的语音助手进行基准测试。它解决了在开放问答、推理、指令遵循等不同任务中,语音助手缺乏一致评估指标的问题。

如何工作

该项目由一个托管在 Hugging Face 上的综合性数据集和一个评估流水线组成。该流水线分为三个步骤:

  1. 响应生成:使用音频或文本模态向语音助手模型(例如 Qwen2、Diva)发送提示,生成响应。
  2. 自动评估:对于特定子集(如 alpacaevalwildvoice),使用 gpt-4o-mini 作为自动评判者对响应进行评分。
  3. 最终结果计算:专用评估脚本根据评估者类型(例如 mcq 用于多选题,bbh 用于推理,harm 用于安全性)计算最终得分。

适用人群

该工具专为开发大型音频语言模型(LALMs)或语音助手的研究人员和开发者设计,帮助他们衡量模型能力,并与领先模型的排行榜进行比较。

主要亮点

  • 多样化的数据集:包含多个子集,涵盖开放问答、多选问答、推理、安全性和指令遵循等任务。
  • 真人录音语音:包含 wildvoicebbh 等众包数据集,收录了具有多种口音的真实人类录音。
  • 自动评判:集成基于 GPT-4 的评估机制,用于开放问答类响应。
  • 广泛覆盖:涵盖 12 个不同领域,包括来自 mmlu-pro 的内容。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目