AudioLLMs/AudioBench
AudioBench: A Universal Benchmark for Audio Large Language Models
解決的問題
AudioBench 為評估音訊大語言模型 (AudioLLMs) 提供了一個標準化的通用基準測試。它解決了缺乏綜合評估框架的問題,該框架無法在包括語音識別、音訊場景理解與語音特性在內的各種音訊任務中對模型進行測試。
工作原理
該框架允許使用者在廣泛的音訊數據集上執行推論,並使用不同的指標評估結果。它支援「以模型作為裁判 (model-as-judge)」的方法,透過 vLLM 提供強大的 LLM(如 Llama-3-70B)來對被測試模型的回答進行評分。它還支援用於 ASR 與翻譯任務的傳統指標,例如字錯率 (WER) 與 BLEU。
適用對象
專為正在構建或微調 AudioLLMs 的 AI 研究人員與開發人員設計,他們需要衡量模型在語音、音樂與環境音訊理解方面的性能。
亮點
- 廣泛的數據集支援:涵蓋超過 50 個數據集,橫跨 ASR、語音翻譯、問答、情感識別與音樂理解。
- 多樣化的任務覆蓋:評估語音、音訊場景與語音理解的能力。
- Model-as-Judge 整合:內建支援使用 LLM 來評估開放式回答。
- 可擴展的架構:向基準測試套件添加新的自定義數據集與模型的簡單流程。
相關
- 專案
- 專案
- 專案
- 專案
- 專案