EVA 端到端语音代理评估框架

EVA 端到端语音代理评估框架

EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。

EVA 端到端语音代理评估框架

TL;DR

EVA 是 ServiceNow 发布的全新端到端评估框架,可对对话式语音代理的任务准确性(EVA‑A)和用户体验(EVA‑X)进行联合评分,提供首个同时捕获这两个维度的基准,并揭示它们之间的一致权衡。


引言

语音代理必须同时实现两个交织的目标:正确完成用户任务(准确性)以及提供自然、简洁、及时的语音交互(体验)。现有基准分别评估这些目标,导致在完整对话中才会出现的错误被隐藏。EVA 通过在真实的 bot‑to‑bot 环境中评估多轮语音对话,生成两个高级评分——EVA‑A 用于准确性,EVA‑X 用于体验,从而填补了这一空白。


背景与动机

当前的语音代理基准侧重于单一组件,例如语音转文本质量(AudioBench、SD‑Eval、VoxEval)、感知语音质量(EmergentTTS‑Eval、SHEET)或对话动态(Talking Turns、Full‑Duplex‑Bench)。少数近期工作(VoiceAgentBench、CAVA)开始评估工具调用和指令遵循,但仍未对结合任务编排与对话流畅性的完整多步骤语音工作流进行评估。这种碎片化的评估格局使得无法衡量准确性与体验在真实部署中的相互作用,因而需要一个统一的框架。


EVA 框架

架构

EVA 使用五个核心组件模拟实时音频对话:

  1. User Simulator – 一个以目标驱动的对话式 AI,通过高质量 TTS 生成逼真的语音输入。
  2. Voice Agent – 被测系统,使用 Pipecat 构建,支持级联(STT → LLM → TTS)和音频原生(S2S 或 LALM)流水线。
  3. Tool Executor – 确定性的 Python 函数,提供可复现的工具响应并更新特定场景的数据库。
  4. Validators – 自动检查,确保每段对话达到有效的结束状态;无效运行会被重新生成,免除人工事后标注的需求。
  5. Metrics Suite – 一组确定性和 LLM‑as‑judge 指标,用于分析音频录音、转录文本以及工具调用日志。

EVA 架构

数据

首次发布随附一个合成航空数据集,包含 50 个场景和 15 种工具,覆盖航班改签、取消、候补和代金券发放。每个场景定义如下:

  • User Goal – 呼叫者希望完成的精确任务。
  • User Persona – 说话风格、耐心程度和人格特质。
  • Scenario Database – 工具查询的后端数据。
  • Ground Truth – 成功交互后数据库的预期最终状态。

该数据集已在 Hugging Face 上发布,可通过 EVA 演示站点进行探索。


评估方法论

EVA 报告两个主要分数以及一组诊断指标。

EVA‑A:准确性

准确性通过以下三条轴线进行衡量:

  • Task Completion (deterministic) – 检查最终数据库状态是否与 Ground Truth 匹配。
  • Faithfulness (LLM‑as‑Judge) – 检测代理语音响应中的幻觉、策略违规或误述。
  • Speech Fidelity (LALM‑as‑Judge) – 评估代理的音频输出是否正确呈现关键实体,如确认码、航班号和金额。

EVA‑X:体验

体验通过以下三条互补轴线进行衡量,全部使用 LLM‑as‑Judge:

  • Conciseness – 奖励简短、聚焦的回复,适合无法快速浏览的电话用户。
  • Conversation Progression – 奖励前进式对话,避免重复并保持上下文。
  • Turn‑Taking – 奖励合适的时机,即不打断对方且最小化沉默。

Pass@k 与 Pass^k

EVA 对每个场景运行三次试验(k = 3),并报告:

  • pass@k – 至少有一次试验成功的概率。
  • pass^k – 三次试验全部成功的概率。 这些指标同时捕捉峰值性能和一致性。

关键发现

  • Accuracy‑Experience Trade‑off – 在 20 个评估系统(包括专有和开源、级联和音频原生)中,任务完成分数越高,体验分数越差,反之亦然。仅衡量任务成功的基准无法看到此权衡。
  • Named‑Entity Transcription Errors – 确认码中单个字符的误识别常导致身份验证失败和整段对话崩溃。
  • Multi‑Step Workflow Fragility – 在保留附加服务(座位、行李)的情况下重新预订航班是所有配置中最常见的失败点。
  • Consistency Gap – 所有系统的 pass@3 与 pass^3 之间差距较大,表明许多代理只能偶尔完成任务,缺乏可靠性。

早期结果散点图


局限性

  • Metric Bias – LLM‑as‑Judge 模型继承其训练数据的偏见,可能偏好特定的响应风格;二元任务完成评分忽略了部分得分。
  • Domain & Language Coverage – 当前版本仅包含 50 个英文航空场景;结果可能无法推广到其他领域、语言或口音。
  • Simulation Fidelity – 用户模拟器使用单一商业 TTS 提供商,可能无法捕捉真实世界的口误、情感或多样的说话风格。bot‑to‑bot 流水线也抽象了生产级延迟和基础设施差异。
  • Resource Requirements – 完全复现需要商业 TTS/ASR 服务的 API 访问权限,且延迟测量会因提供商而异。

未来路线图

  • Prosodic Quality – 添加发音、节奏和表现力的指标,以解决当前 LALM‑as‑Judge 分数与人工评判之间的低一致性。
  • Robustness Testing – 引入噪声音频、多种口音、多语言用户以及针对情绪紧张呼叫者的情感感知评估。
  • Domain Expansion – 发布涵盖不同政策结构、实体类型和更长对话记忆的额外数据集。
  • Error‑Analysis Tooling – 提供一个应用程序,自动展示各指标错误、典型示例以及模型优势与劣势的结构化摘要。
  • Leaderboard Growth – 持续更新公开排行榜,跟踪社区中最先进的语音代理性能。

致谢

核心贡献者:Tara Bogavelli、Gabrielle Gauthier Melançon、Katrina Stankiewicz、Oluwanifemi Bamgbose、Hoang Nguyen、Raghav Mehndiratta 和 Hari Subramani。特别感谢 Lindsay Brin、Akshay Kalkunte、Joseph Marinier、Jishnu Nair、Aman Tiwari、Fanny Riols、Anil Madamala、Sridhar Nemala、Srinivas Sunkara,以及 ServiceNow PAVA 和 CLAE 团队。


引用

@misc{eva-2026,
  title={A New End-to-end Framework for Evaluating Voice Agents (EVA)},
  author={Bogavelli, Tara and Gauthier Melançon, Gabrielle and Stankiewicz, Katrina and Bamgbose, Oluwanifemi and Nguyen, Hoang and Mehndiratta, Raghav and Subramani, Hari},
  year={2026},
  url={https://github.com/ServiceNow/eva}
}

Sources