MatthewCYM/VoiceBench
[TACL'26] VoiceBench: Benchmarking LLM-Based Voice Assistants
解決的問題
VoiceBench 提供一個標準化的框架與資料集,用於基於大語言模型(LLM)的語音助理的基準測試。它解決了在開放式問答、推理、指令遵循等不同任務中,語音助理缺乏一致評估指標的問題。
如何運作
此專案由一個托管於 Hugging Face 上的綜合性資料集與評估流程組成。該流程分為三個步驟:
- 回應生成:使用音訊或文字模態向語音助理模型(例如 Qwen2、Diva)發送提示,產生回應。
- 自動評估:針對特定子集(如
alpacaeval和wildvoice),使用gpt-4o-mini作為自動評審者對回應進行評分。 - 最終結果計算:專用評估腳本根據評審類型(例如
mcq用於多選題,bbh用於推理,harm用於安全性)計算最終分數。
適用對象
此工具專為開發大型音訊語言模型(LALMs)或語音助理的研究人員與開發者設計,幫助他們衡量模型能力,並與其他先進模型的排行榜進行比較。
主要亮點
- 多樣化的資料集:包含多個子集,涵蓋開放式問答、多選問答、推理、安全性與指令遵循等任務。
- 真人錄音語音:包含
wildvoice和bbh等眾包資料集,收錄具有多樣口音的真實人類錄音。 - 自動評審:整合基於 GPT-4 的評估機制,用於開放式問答類回應。
- 廣泛覆蓋:涵蓋 12 個不同領域,包括來自
mmlu-pro的內容。
相關
- 專案
- 專案
- 專案
- 專案
- 專案