AudioLLMs/AudioBench

AudioBench: A Universal Benchmark for Audio Large Language Models

解決する課題

AudioBenchは、音声大規模言語モデル(AudioLLMs)を評価するための標準化されたユニバーサルなベンチマークを提供します。これは、音声認識、オーディオシーンの理解、音声特性を含む、多様なオーディオタスクにわたってモデルをテストできる包括的な評価フレームワークが不足しているという課題に対処します。

仕組み

このフレームワークにより、ユーザーは幅広いオーディオデータセットで推論を実行し、さまざまな指標を使用して結果を評価できます。「model-as-judge」アプローチをサポートしており、強力なLLM(Llama-3-70Bなど)がvLLMを介して提供され、テスト対象のモデルの回答を採点します。また、ASRおよび翻訳タスク用のWord Error Rate (WER) や BLEU といった従来の指標もサポートしています。

対象者

音声、音楽、および環境オーディオの理解におけるモデルのパフォーマンスを測定する必要がある、AudioLLMsを構築または微調整しているAI研究者や開発者向けに設計されています。

ハイライト

  • 広範なデータセットサポート: ASR、音声翻訳、質問回答、感情認識、音楽理解にわたる50以上のデータセットをカバー。
  • 多様なタスクの網羅性: 音声、オーディオシーン、および音声理解の能力を評価。
  • Model-as-Judgeの統合: オープンエンドな回答を評価するためにLLMを使用するための組み込みサポート。
  • 拡張可能なアーキテクチャ: ベンチマークスイートに新しいカスタムデータセットやモデルを追加するためのシンプルなプロセス。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト