Big Bench Audio 發布

Artificial Analysis 已發布 Big Bench Audio,這是一個新的評估資料集,旨在評估音訊語言模型的推理能力。該資料集揭示了顯著的「語音推理差距」,即模型在處理音訊時的表現明顯弱於處理文字,即使底層推理任務相同。

Big Bench Audio 資料集

Big Bench Audio 由 1,000 個改編自 Big Bench Hard 的音訊問題組成,Big Bench Hard 是一個以嚴格測試高級推理而聞名的基準。該資料集在四個類別中均衡分布,每類各有 250 個問題:

  • 形式謬誤:根據提供的陳述進行邏輯演繹的測試。
  • 導航:判斷導航步驟是否返回起點。
  • 物體計數:計算集合內特定物品的數量。
  • 謊言網:評估以自然語言表達的布林邏輯。

為確保品質,音訊檔案是使用來自排名前列的 Text to Speech (TTS) 模型的 23 個合成聲音生成的。每次生成都會使用 Levenshtein 距離與轉錄檔進行比對,並進行邊緣案例的人工審查。

評估方法與配置

為了隔離音訊對推理的影響,Artificial Analysis 在四種不同的配置下測試了模型:

  1. 語音到語音:音訊輸入 $ ightarrow$ 音訊輸出。
  2. 語音到文字:音訊輸入 $ ightarrow$ 文字輸出。
  3. 文字到語音:文字輸入 $ ightarrow$ 音訊輸出。
  4. 文字到文字:文字輸入 $ ightarrow$ 文字輸出。

實驗設置

進行了十八項實驗,涉及 GPT-4o 的各個版本(包括 Realtime Preview 和 mini Realtime Preview)、Gemini 1.5 Flash、Gemini 1.5 Pro 以及 Gemini 2.0 Flash (Experimental)。

評估透過 LLM 評估器(Claude 3.5 Sonnet, Oct '24)自動化進行。系統透過 OpenAI 的 Whisper API 轉錄音訊回應,然後提示評估器根據官方答案和原始問題情境,將候選答案標記為「CORRECT」或「INCORRECT」。

主要發現:語音推理差距

Big Bench Audio 分析的主要發現是,從文字模態過渡到語音模態時,效能顯著下降。

效能下降

以 GPT-4o 為主要例子,研究顯示準確率有明顯下降:

  • 文字到文字:92% 準確率 (GPT-4o Aug '24)。
  • 文字到語音:74% 準確率。
  • 語音到語音:66% 準確率 (GPT-4o Realtime Preview Oct '24)。

此數據表明,語音輸入和語音輸出都導致了推理性能的下降。

管線 vs. 原生音訊

傳統管線方法——即依序使用 Whisper (轉錄)、GPT-4o (推理) 和 TTS-1 (聲音生成)——目前在推理任務上表現優於原生語音到語音模型。這些管線與純文字處理相比,顯示出極小的效能下降,這表明在推理準確度是最高優先順位的應用中,管線架構目前比原生音訊模型更可靠。

Sources