MatthewCYM/VoiceBench
[TACL'26] VoiceBench: Benchmarking LLM-Based Voice Assistants
해결하는 문제
VoiceBench는 LLM 기반 음성 어시스턴트의 성능을 평가하기 위한 표준화된 프레임워크와 데이터셋을 제공합니다. 오픈 엔드 QA, 추론, 지시 따르기와 같은 다양한 작업에서 일관성 없는 평가 지표의 부족을 해결합니다.
작동 방식
이 프로젝트는 Hugging Face에 호스팅된 포괄적인 데이터셋과 평가 파이프라인으로 구성됩니다. 파이프라인은 세 단계로 작동합니다:
- 응답 생성: 음성 또는 텍스트 모달리티를 사용하여 음성 어시스턴트 모델(Qwen2, Diva 등)에 응답을 생성하도록 프롬프트를 전달합니다.
- 자동 평가:
alpacaeval및wildvoice와 같은 특정 서브셋에 대해gpt-4o-mini를 자동 평가자로 사용하여 응답을 점수 매깁니다. - 최종 결과 계산: 평가자 유형(e.g.,
mcq는 다중 선택,bbh는 추론,harm는 안전성)에 따라 전용 평가 스크립트가 최종 점수를 계산합니다.
대상 사용자
이 도구는 Large Audio Language Models (LALMs) 또는 음성 어시스턴트를 개발하는 연구자 및 개발자들을 위한 것으로, 모델의 능력을 측정하고 다른 최첨단 모델의 랭킹과 비교할 수 있도록 도와줍니다.
주요 특징
- 다양한 데이터셋: 오픈 엔드 QA, 다중 선택 QA, 추론, 안전성, 지시 따르기 등을 포함하는 여러 서브셋을 보유합니다.
- 사람이 녹음한 음성:
wildvoice및bbh와 같은 커뮤니티 기반 데이터셋은 다양한 억양을 가진 사람들의 실제 녹음 음성 포함합니다. - 자동 평가: 오픈 엔드 응답에 대해 GPT-4 기반 평가를 통합합니다.
- 광범위한 커버리지:
mmlu-pro에서 제공하는 도메인을 포함해 총 12개의 다양한 도메인을 테스트합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트