Big Bench Audio 发布

Artificial Analysis 发布了 Big Bench Audio,这是一个新的评估数据集,旨在评估音频语言模型的推理能力。该数据集揭示了显著的“语音推理差距”,即模型在处理音频时相比文本表现显著较差,即使底层推理任务相同。

Big Bench Audio 数据集

Big Bench Audio 包含 1,000 个音频问题,这些问题改编自 Big Bench Hard,这是一个以严格测试高级推理而闻名的基准。该数据集在四个类别之间保持平衡,每类 250 个问题:

  • 形式谬误:从提供的陈述中进行逻辑推断的测试。
  • 导航:确定导航步骤是否返回起点。
  • 对象计数:计算集合内特定项的数量。
  • 谎言之网:评估用自然语言表达的布尔逻辑。

为了确保质量,音频文件使用来自顶级排名的文本转语音(TTS)模型的 23 种合成声音生成。每次生成都通过与转录本的莱文斯坦距离以及对边缘情况的手动审查进行验证。

评估方法和配置

为了隔离音频对推理的影响,Artificial Analysis 在四种不同的配置上测试了模型:

  1. 语音到语音:音频输入 $ ightarrow$ 音频输出。
  2. 语音到文本:音频输入 $ ightarrow$ 文本输出。
  3. 文本到语音:文本输入 $ ightarrow$ 音频输出。
  4. 文本到文本:文本输入 $ ightarrow$ 文本输出。

实验设置

进行了十八项实验,涉及 GPT-4o 的各种版本(包括实时预览和迷你实时预览)、Gemini 1.5 Flash、Gemini 1.5 Pro 和 Gemini 2.0 Flash(实验版)。

评估使用 LLM 评估器(Claude 3.5 Sonnet,2024 年 10 月)自动化进行。系统通过 OpenAI 的 Whisper API 转录音频响应,然后提示评估器根据官方答案和原始问题上下文将候选答案标记为“CORRECT”或“INCORRECT”。

关键发现:音频推理差距

Big Bench Audio 分析的主要发现是,从文本过渡到语音模态时会出现显著的性能下降。

性能下降

以 GPT-4o 为主要示例,研究显示准确率明显下降:

  • 文本到文本:92% 准确率(GPT-4o 2024 年 8 月)。
  • 文本到语音:74% 准确率。
  • 语音到语音:66% 准确率(GPT-4o 实时预览 2024 年 10 月)。

这些数据表明,语音输入和语音输出都导致了推理性能的下降。

管道 vs. 原生音频

传统管道方法——它们使用 Whisper(转录)、GPT-4o(推理)和 TTS-1(语音生成)的序列——目前在推理任务中优于原生语音到语音模型。这些管道相比纯文本处理显示出最小的性能下降,这表明对于推理准确性是最高优先级的应用,管道架构目前比原生音频模型更可靠。

Sources