Real World VoiceEQ: 测量语音 AI 中的人类质量
Real World VoiceEQ: 测量语音 AI 中的人类质量
Hugging Face 和 Hume AI 推出了 Real World VoiceEQ,这是一个新的基准,旨在测量语音交互的人类质量。此框架超越了诸如词错误率(WER)之类的技术指标,以评估语音 AI 如何识别、生成和响应声学信息——例如语调、情感和背景上下文——这些信息通常在文本转录中会丢失。
语音 AI 评估的综合框架
Real World VoiceEQ 通过评估系统是否能够处理真实世界对话的细微差别,为语音 AI 提供了更广泛的测量层。该基准在超过 15 个关键评估维度和 60 个指标上评估了超过 40 个专有和开源语音模型。这些指标涵盖四个主要组成部分:
- 自动语音识别(ASR)鲁棒性:测试在各种条件下准确转录语音的能力。
- 文本到语音(TTS):评估生成语音的质量和自然度。
- 语音到语音(S2S):测量语音交互的端到端流程。
- 语音理解:评估模型从声学线索解释意义的能力。
为了确保与人类感知的一致性,该基准是在跨越不同人口统计、说话风格和声学环境的超过 100 万条个别人类评分的基础上开发的,其中包括 785,000 条 TTS 评分和 48,000 条 STS 评分。评估是使用 Kairos 进行的,Kairos 是一个原生语音评估平台。
语音 AI 现状的关键发现
Real World VoiceEQ 评估揭示了基准性能与实际效用之间存在几个关键差距。
专业化胜过泛化
没有单一的“最佳”语音模型。该领域的进展正在转向专业化能力。一些模型在技术准确性方面表现出色(例如,朗读复杂的药品名称或银行详情),而其他模型则在情感表达或对话智能方面表现出色。在 TTS 评估中,没有单一的系统配置在所有八个能力组中排名前五。
说话与倾听之间的差距
语音到语音模型在性能上表现出最大的变化。一个重要的发现是,拥有音频访问权并不保证模型会利用副语言信息。许多系统仍然以转录为驱动,忽略了诸如语速、犹豫、强调和音量等线索。这导致无法识别关键的人类细微差别,例如自信的 “Yes” 与犹豫的 “...yes...” 之间的区别,这可能根本改变响应的意义。
传统基准的局限性
传统基准经常高估实际性能,因为它们往往无法反映复杂条件。Real World VoiceEQ 发现,领先模型之间的性能变化比传统指标所暗示的要显著得多。例如,在有噪声背景的语音上的转录词错误率大约是有音乐背景的语音上的四倍,这表明单一的汇总背景音频得分可能掩盖特定的失效模式。
人工评估的必要性
虽然大型语言模型(LLMs)和语言-语音模型(SLMs)越来越多地用于自动评估,但它们目前尚无法取代人类听众进行主观判断。
研究表明,一些模型可能针对公共基准进行了优化,偶尔会在参考转录中重现已知错误或重建音频中不存在的被掩蔽词。在将 SLMs 与人类评分者在 TTS 评估中进行比较时,对于可验证的任务(如发音准确性)的一致性很高,但对于主观评估(如声音是否适合特定的表演角色或保持一致身份)的一致性则下降。这表明自动评估器在声学上下文、感知和社会解释方面存在困难。