MatthewCYM/VoiceBench

[TACL'26] VoiceBench: Benchmarking LLM-Based Voice Assistants

解決的問題

VoiceBench 提供一個標準化的框架與資料集,用於基於大語言模型(LLM)的語音助理的基準測試。它解決了在開放式問答、推理、指令遵循等不同任務中,語音助理缺乏一致評估指標的問題。

如何運作

此專案由一個托管於 Hugging Face 上的綜合性資料集與評估流程組成。該流程分為三個步驟:

  1. 回應生成:使用音訊或文字模態向語音助理模型(例如 Qwen2、Diva)發送提示,產生回應。
  2. 自動評估:針對特定子集(如 alpacaevalwildvoice),使用 gpt-4o-mini 作為自動評審者對回應進行評分。
  3. 最終結果計算:專用評估腳本根據評審類型(例如 mcq 用於多選題,bbh 用於推理,harm 用於安全性)計算最終分數。

適用對象

此工具專為開發大型音訊語言模型(LALMs)或語音助理的研究人員與開發者設計,幫助他們衡量模型能力,並與其他先進模型的排行榜進行比較。

主要亮點

  • 多樣化的資料集:包含多個子集,涵蓋開放式問答、多選問答、推理、安全性與指令遵循等任務。
  • 真人錄音語音:包含 wildvoicebbh 等眾包資料集,收錄具有多樣口音的真實人類錄音。
  • 自動評審:整合基於 GPT-4 的評估機制,用於開放式問答類回應。
  • 廣泛覆蓋:涵蓋 12 個不同領域,包括來自 mmlu-pro 的內容。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案