Big Bench Audio 출시
Artificial Analysis는 Big Bench Audio를 공개했는데, 이는 음성 언어 모델의 추론 능력을 평가하기 위해 설계된 새로운 평가 데이터셋입니다. 이 데이터셋은 모델이 오디오를 처리할 때 텍스트보다 현저히 성능이 떨어지는 상당한 '음성 추론 격차'를 보여줍니다. 이는基础 reasoning task가 동일할 때도 마찬가지입니다.
Big Bench Audio 데이터셋
Big Bench Audio는 고급 추론을 엄격하게 테스트하는 것으로 알려진 Big Bench Hard에서 각색된 1,000개의 음성 질문으로 구성됩니다. 이 데이터셋은 네 가지 범주에 걸쳐 균형을 이루며, 각 범주당 250개의 질문이 있습니다:
- Formal Fallacies: 제공된 문장에서 논리적 추론을 테스트합니다.
- Navigate: 내비게이션 단계가 시작점으로 돌아오는지 판단합니다.
- Object Counting: 컬렉션 내 특정 항목을 세는 작업.
- Web of Lies: 자연어로 표현된 불리언 논리를 평가합니다.
To ensure quality, the audio files were generated using 23 synthetic voices from top-ranked Text to Speech (TTS) models. Each generation was verified using Levenshtein distance against transcriptions and manual review of edge cases.
평가 방법론 및 구성
오디오가 추론에 미치는 영향을 분리하기 위해, Artificial Analysis는 네 가지 distinct 구성에서 모델을 테스트했습니다.
- Speech to Speech: 음성 입력 $ ightarrow$ 음성 출력
- Speech to Text: 음성 입력 $ ightarrow$ 텍스트 출력
- Text to Speech: 텍스트 입력 $ ightarrow$ 음성 출력
- Text to Text: 텍스트 입력 $ ightarrow$ 텍스트 출력
실험 설정
18개의 실험이 GPT-4o의 다양한 버전(Realtime Preview 및 mini Realtime Preview 포함), Gemini 1.5 Flash, Gemini 1.5 Pro, 그리고 Gemini 2.0 Flash (Experimental)과 함께 수행되었습니다.
평가는 LLM 평가자(Claude 3.5 Sonnet, 2024년 10월)를 사용하여 자동화되었습니다. 시스템은 OpenAI의 Whisper API를 통해 오디오 응답을 전사한 다음, 공식 답변과 원래 질문 맥락을 기반으로 평가자에게 후보 답변을 'CORRECT' 또는 'INCORRECT'로 라벨링하도록 요청합니다.
주요 발견: 음성 추론 격차
Big Bench Audio 분석의 주요 발견은 텍스트에서 음성 모달리티로 전환할 때 상당한 성능 저하가 발생한다는 것입니다.
성능 저하
GPT-4o를 주요 예시로 사용할 때, 연구는 정확도의 명확한 감소를 보여줍니다:
- Text to Text: 92% 정확도 (GPT-4o 2024년 8월).
- Text to Speech: 74% 정확도.
- Speech to Speech: 66% 정확도 (GPT-4o Realtime Preview 2024년 10월).
이 데이터는 음성 입력과 음성 출력이 모두 추론 성능 저하에 기여함을 나타냅니다.
파이프라인 vs. 네이티브 오디오
Whisper(전사), GPT-4o(추론), TTS-1(음성 생성)의 시퀀스를 활용하는 전통적인 파이프라인 접근 방식은 현재 추론 작업에서 네이티브 Speech to Speech 모델보다 성능이 더 좋습니다. 이러한 파이프라인은 순수 텍스트 처리와 비교했을 때 성능 저하가 최소이며, 이는 추론 정확도가 최우선인 응용 프로그램에서는 파이프라인 아키텍처가 현재 네이티브 오디오 모델보다 더 신뢰할 수 있음을 시사합니다.