MatthewCYM/VoiceBench
[TACL'26] VoiceBench: Benchmarking LLM-Based Voice Assistants
解决的问题
VoiceBench 提供了一个标准化的框架和数据集,用于对基于大语言模型(LLM)的语音助手进行基准测试。它解决了在开放问答、推理、指令遵循等不同任务中,语音助手缺乏一致评估指标的问题。
如何工作
该项目由一个托管在 Hugging Face 上的综合性数据集和一个评估流水线组成。该流水线分为三个步骤:
- 响应生成:使用音频或文本模态向语音助手模型(例如 Qwen2、Diva)发送提示,生成响应。
- 自动评估:对于特定子集(如
alpacaeval和wildvoice),使用gpt-4o-mini作为自动评判者对响应进行评分。 - 最终结果计算:专用评估脚本根据评估者类型(例如
mcq用于多选题,bbh用于推理,harm用于安全性)计算最终得分。
适用人群
该工具专为开发大型音频语言模型(LALMs)或语音助手的研究人员和开发者设计,帮助他们衡量模型能力,并与领先模型的排行榜进行比较。
主要亮点
- 多样化的数据集:包含多个子集,涵盖开放问答、多选问答、推理、安全性和指令遵循等任务。
- 真人录音语音:包含
wildvoice和bbh等众包数据集,收录了具有多种口音的真实人类录音。 - 自动评判:集成基于 GPT-4 的评估机制,用于开放问答类响应。
- 广泛覆盖:涵盖 12 个不同领域,包括来自
mmlu-pro的内容。
相关
- 项目
- 项目
- 项目
- 项目
- 项目