AudioLLMs/AudioBench

AudioBench: A Universal Benchmark for Audio Large Language Models

解決的問題

AudioBench 為評估音訊大語言模型 (AudioLLMs) 提供了一個標準化的通用基準測試。它解決了缺乏綜合評估框架的問題,該框架無法在包括語音識別、音訊場景理解與語音特性在內的各種音訊任務中對模型進行測試。

工作原理

該框架允許使用者在廣泛的音訊數據集上執行推論,並使用不同的指標評估結果。它支援「以模型作為裁判 (model-as-judge)」的方法,透過 vLLM 提供強大的 LLM(如 Llama-3-70B)來對被測試模型的回答進行評分。它還支援用於 ASR 與翻譯任務的傳統指標,例如字錯率 (WER) 與 BLEU。

適用對象

專為正在構建或微調 AudioLLMs 的 AI 研究人員與開發人員設計,他們需要衡量模型在語音、音樂與環境音訊理解方面的性能。

亮點

  • 廣泛的數據集支援:涵蓋超過 50 個數據集,橫跨 ASR、語音翻譯、問答、情感識別與音樂理解。
  • 多樣化的任務覆蓋:評估語音、音訊場景與語音理解的能力。
  • Model-as-Judge 整合:內建支援使用 LLM 來評估開放式回答。
  • 可擴展的架構:向基準測試套件添加新的自定義數據集與模型的簡單流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案