Real World VoiceEQ: 評估語音 AI 中的人類品質

Real World VoiceEQ: 評估語音 AI 中的人類品質

Hugging Face 與 Hume AI 推出了 Real World VoiceEQ,這是一個新的基準,旨在衡量語音互動的人類品質。此框架超越了如詞錯誤率(WER)之類的技術指標,以評估語音 AI 如何識別、產生並回應聲學資訊——例如語調、情感和背景環境——這些通常在文字逐字稿中會遺失。

語音 AI 評估的綜合框架

Real World VoiceEQ 透過評估系統是否能處理真實世界對話的細節,為語音 AI 提供了更廣泛的測量層。該基準在超過 15 個關鍵評估維度和 60 個指標上評估了超過 40 個專有和開源語音模型。這些指標涵蓋四個主要組成部分:

  • Automatic Speech Recognition (ASR) Robustness: 測試在各種條件下準確轉錄語音的能力。
  • Text-to-Speech (TTS): 評估生成語音的品質與自然度。
  • Speech-to-Speech (S2S): 測量語音互動的端到端流程。
  • Speech Understanding: 評估模型從聲學線索解釋含義的能力。

為確保與人類感知相扣連,該基準是使用超過 100 萬份來自不同人口統計、說話風格和聲學環境的個人人類評分開發而成,其中包括 785,000 份 TTS 評分和 48,000 份 STS 評分。評估是透過 Kairos 進行的,Kairos 是一個以語音為原生的評估平台。

語音 AI 現狀的關鍵發現

Real World VoiceEQ 評估揭示了基準表現與真實世界實用性之間的若幾個關鍵差距。

專業化勝過泛化

沒有單一的「最佳」語音模型。該領域的進展正朝著專業能力轉移。某些模型在技術準確性方面表現出色(例如,朗誦複雜的藥品名稱或銀行細節),而其他模型則在情感表達或對話智能方面表現出色。在 TTS 評估中,沒有單一系統配置在所有八個能力組別中進入前五名。

說與聽之間的差距

Speech-to-Speech 模型在表現上展現出最廣泛的變化。一個重要發現是,擁有音訊的存取並不保證模型會利用準語言資訊。許多系統仍然以逐字稿為主導,忽略了如語速、猶豫、強調和音量等線索。這導致無法識別關鍵的人類細微差別,例如自信的「Yes」與猶豫的「...yes...」之間的差異,這可能根本改變回應的含義。

傳統基準的限制

傳統基準經常高估真實世界的表現,因為它們常常無法反映複雜條件。Real World VoiceEQ 發現,領先模型之間的表現變化遠大於傳統指標所顯示的。例如,噪音背景語音的轉錄詞錯誤率約為音樂背景語音的四倍,這表明單一的彙總背景音訊分數可能掩蓋特定的失效模式。

人類評估的必要性

雖然大型語言模型(LLMs)和語音語言模型(SLMs)正越來越多地用於自動評估,但它們尚無法取代人類聽眾進行主觀判斷。

研究顯示,某些模型可能被優化以應對公開基準,偶爾會在參考逐字稿中重現已知錯誤,或重建音訊中不存在的遮蔽詞。在將 SLMs 與人類評分者在 TTS 評估中進行比較時,對於可驗證的任務(如發音準確性)的一致性很高,但對於主觀評估(例如聲音是否適合特定表演角色或保持一致身份)的一致性則下降。這表明自動評估器在聲學環境、感知和社會解釋方面存在困難。

Sources