Big Bench Audio 發布
Artificial Analysis 已發布 Big Bench Audio,這是一個新的評估資料集,旨在評估音訊語言模型的推理能力。該資料集揭示了顯著的「語音推理差距」,即模型在處理音訊時的表現明顯弱於處理文字,即使底層推理任務相同。
Big Bench Audio 資料集
Big Bench Audio 由 1,000 個改編自 Big Bench Hard 的音訊問題組成,Big Bench Hard 是一個以嚴格測試高級推理而聞名的基準。該資料集在四個類別中均衡分布,每類各有 250 個問題:
- 形式謬誤:根據提供的陳述進行邏輯演繹的測試。
- 導航:判斷導航步驟是否返回起點。
- 物體計數:計算集合內特定物品的數量。
- 謊言網:評估以自然語言表達的布林邏輯。
為確保品質,音訊檔案是使用來自排名前列的 Text to Speech (TTS) 模型的 23 個合成聲音生成的。每次生成都會使用 Levenshtein 距離與轉錄檔進行比對,並進行邊緣案例的人工審查。
評估方法與配置
為了隔離音訊對推理的影響,Artificial Analysis 在四種不同的配置下測試了模型:
- 語音到語音:音訊輸入 $ ightarrow$ 音訊輸出。
- 語音到文字:音訊輸入 $ ightarrow$ 文字輸出。
- 文字到語音:文字輸入 $ ightarrow$ 音訊輸出。
- 文字到文字:文字輸入 $ ightarrow$ 文字輸出。
實驗設置
進行了十八項實驗,涉及 GPT-4o 的各個版本(包括 Realtime Preview 和 mini Realtime Preview)、Gemini 1.5 Flash、Gemini 1.5 Pro 以及 Gemini 2.0 Flash (Experimental)。
評估透過 LLM 評估器(Claude 3.5 Sonnet, Oct '24)自動化進行。系統透過 OpenAI 的 Whisper API 轉錄音訊回應,然後提示評估器根據官方答案和原始問題情境,將候選答案標記為「CORRECT」或「INCORRECT」。
主要發現:語音推理差距
Big Bench Audio 分析的主要發現是,從文字模態過渡到語音模態時,效能顯著下降。
效能下降
以 GPT-4o 為主要例子,研究顯示準確率有明顯下降:
- 文字到文字:92% 準確率 (GPT-4o Aug '24)。
- 文字到語音:74% 準確率。
- 語音到語音:66% 準確率 (GPT-4o Realtime Preview Oct '24)。
此數據表明,語音輸入和語音輸出都導致了推理性能的下降。
管線 vs. 原生音訊
傳統管線方法——即依序使用 Whisper (轉錄)、GPT-4o (推理) 和 TTS-1 (聲音生成)——目前在推理任務上表現優於原生語音到語音模型。這些管線與純文字處理相比,顯示出極小的效能下降,這表明在推理準確度是最高優先順位的應用中,管線架構目前比原生音訊模型更可靠。