EVA 端對端語音代理評估框架
EVA 端對端語音代理評估框架
EVA 是一個全新的端對端框架,能同時評估語音代理的準確度與對話體驗,揭示任務成功與使用者滿意度之間的一致權衡。
EVA 端對端語音代理評估框架
TL;DR
EVA 是 ServiceNow 推出的全新端對端評估框架,能同時對會話語音代理的任務準確度(EVA‑A)與使用者體驗(EVA‑X)進行評分,提供首個同時捕捉這兩個面向的基準,並揭示它們之間的一致權衡。
介紹
語音代理必須同時達成兩個交織的目標:正確完成使用者的任務(準確度)以及提供自然、簡潔且即時的語音互動(體驗)。現有的基準往往孤立評估這些目標,導致只有在完整對話中才會顯現的失敗被隱藏。EVA 透過在真實的 bot‑to‑bot 設定下評估多輪語音對話,並產生兩個高層次分數——EVA‑A 代表準確度,EVA‑X 代表體驗,以填補此缺口。
背景與動機
目前的語音代理基準多聚焦於單一元件,如語音轉文字品質(AudioBench、SD‑Eval、VoxEval)、感知語音品質(EmergentTTS‑Eval、SHEET)或對話動態(Talking Turns、Full‑Duplex‑Bench)。少數近期研究(VoiceAgentBench、CAVA)開始評估工具呼叫與指令遵循,但尚未有能同時評估結合任務編排與對話流暢性的完整多步語音工作流程。這種碎片化的評估環境使得無法衡量準確度與體驗在實際部署中的相互作用,因而促成統一框架的需求。
EVA 框架
架構
EVA 使用五個核心元件模擬即時音訊對話:
- User Simulator – 以目標驅動的對話式 AI,透過高品質 TTS 產生真實的語音輸入。
- Voice Agent – 被測試的系統,使用 Pipecat 建置,支援串接式(STT → LLM → TTS)與音訊原生(S2S 或 LALM)管線。
- Tool Executor – 確定性的 Python 函式,提供可重現的工具回應並更新情境特定的資料庫。
- Validators – 自動化檢查,確保每段對話達到有效的結束狀態;若不符合則重新生成,免除人工事後標記的需求。
- Metrics Suite – 一組結合確定性與 LLM‑as‑judge 的指標,用以分析音訊錄製、文字稿與工具呼叫日誌。

資料
首次發布附帶一個合成航空資料集,包含 50 個情境與 15 種工具,涵蓋航班改訂、取消、候補與兌換券發放。每個情境定義了:
- User Goal – 呼叫者欲完成的精確任務。
- User Persona – 語音風格、耐心程度與個性特徵。
- Scenario Database – 工具查詢的後端資料。
- Ground Truth – 成功互動後資料庫預期的最終狀態。
此資料集可於 Hugging Face 取得,並可透過 EVA 示範網站進行探索。
評估方法
EVA 會報告兩個主要分數以及一組診斷指標。
EVA‑A:準確度
準確度透過三個面向衡量:
- Task Completion(確定性)– 檢查最終資料庫狀態是否與 Ground Truth 相符。
- Faithfulness(LLM‑as‑Judge)– 偵測代理語音回應中的幻覺、政策違規或錯誤陳述。
- Speech Fidelity(LALM‑as‑Judge)– 評估代理的音訊輸出是否正確呈現關鍵實體,如確認碼、航班號碼與金額。
EVA‑X:體驗
體驗透過三個互補的面向衡量,皆使用 LLM‑as‑Judge:
- Conciseness – 獎勵簡潔、聚焦的回覆,適合無法快速瀏覽的電話使用者。
- Conversation Progression – 獎勵前進式對話,避免重複並維持上下文。
- Turn‑Taking – 獎勵適當的時機掌握,即不打斷且最小化沉默。
Pass@k 與 Pass^k
EVA 為每個情境執行三次試驗(k = 3),並報告:
- pass@k – 至少有一次試驗成功的機率。
- pass^k – 三次試驗全部成功的機率。
這些指標同時捕捉最佳表現與一致性。
主要發現
- Accuracy‑Experience Trade‑off – 在 20 個評估系統(包括專有與開源、串接式與音訊原生)中,較高的任務完成分數始終與較差的體驗分數呈負相關,反之亦然。此權衡在僅測量任務成功的基準中是不可見的。
- Named‑Entity Transcription Errors – 誤認確認碼中的單一字元常導致驗證失敗,進而使整段對話崩潰。
- Multi‑Step Workflow Fragility – 在保留附加服務(座位、行李)的同時重新預訂航班是所有配置中最常見的失敗點。
- Consistency Gap – 所有系統的 pass@3 與 pass^3 之間差距皆相當大,顯示許多代理只能偶爾完成任務,缺乏穩定的表現。

限制
- Metric Bias – LLM‑as‑Judge 模型繼承其訓練資料的偏見,可能偏好特定回應風格;二元任務完成評分忽略部分得分。
- Domain & Language Coverage – 目前的發佈僅包含 50 個英文航空情境;結果可能無法推廣至其他領域、語言或口音。
- Simulation Fidelity – 使用者模擬器僅採用單一商業 TTS 供應商,可能無法捕捉真實世界的口吃、情緒或多樣的說話風格。bot‑to‑bot 管線亦抽象化了生產等級的延遲與基礎設施變化。
- Resource Requirements – 完整重現需要商業 API 存取 TTS/ASR 服務,且延遲測量會因供應商而異。
未來路線圖
- Prosodic Quality – 新增發音、節奏與表情的指標,以解決目前 LALM‑as‑Judge 分數與人工評分之間的低對齊度。
- Robustness Testing – 引入噪音音訊、不同口音、多語言使用者,以及針對焦慮呼叫者的情感感知評估。
- Domain Expansion – 發布涵蓋不同政策結構、實體類型與較長對話記憶的額外資料集。
- Error‑Analysis Tooling – 提供一個自動顯示各指標錯誤、代表性範例與模型優缺點結構化摘要的應用程式。
- Leaderboard Growth – 持續更新公開排行榜,以追蹤社群中最先進語音代理的表現。
致謝
核心貢獻者:Tara Bogavelli、Gabrielle Gauthier Melançon、Katrina Stankiewicz、Oluwanifemi Bamgbose、Hoang Nguyen、Raghav Mehndiratta 與 Hari Subramani。另感謝 Lindsay Brin、Akshay Kalkunte、Joseph Marinier、Jishnu Nair、Aman Tiwari、Fanny Riols、Anil Madamala、Sridhar Nemala、Srinivas Sunkara,以及 ServiceNow PAVA 與 CLAE 團隊。
引用
@misc{eva-2026,
title={A New End-to-end Framework for Evaluating Voice Agents (EVA)},
author={Bogavelli, Tara and Gauthier Melançon, Gabrielle and Stankiewicz, Katrina and Bamgbose, Oluwanifemi and Nguyen, Hoang and Mehndiratta, Raghav and Subramani, Hari},
year={2026},
url={https://github.com/ServiceNow/eva}
}