DABStep: 多步驟推理的數據代理基準
Hugging Face 與 Adyen 已開發出數據代理多步驟推理基準 (DABStep),這是一個由超過 450 個數據分析任務組成的專門評估框架。該基準揭示了當前 AI 代理中存在顯著的效能差距,最強的推理型模型在困難任務集上的準確率僅為 16%。
DABStep 基準設計
DABStep 的設計目的是評估代理工作流程——在此工作流程中,LLM 使用工具獨立執行多步驟任務——特別是在真實世界數據分析的情境下。與合成基準不同,DABStep 使用從實際 Adyen 工作負載中提取的任務來模擬專業數據分析師所面臨的挑戰。
主要特徵
- 真實世界使用案例:該基準利用基於實際工作負載的超過 450 個任務,避免「玩具問題」以更好地反映日常分析挑戰。
- 結構化與非結構化數據:任務要求模型同時瀏覽結構化數據集(CSV、JSON)和非結構化領域知識(markdown 手冊、手冊)。
- 事實評估:為確保客觀且無模型依賴的評分,該基準使用基於簡單詞彙、數字或多選答案的二元(正確/錯誤)結果。
- 多步驟複雜度:任務的設計使得無法透過單次程式碼執行來解決;它們需要迭代問題解決和序列推理。
數據組成
該基準包含各種金融支付領域的數據集,例如:
- payments.csv:匿名化的交易,包含詐騙和風險訊號。
- fees.json:一個包含 1,000 種 Scheme 費用結構的數據集。
- manual.md:一份用於解決任務的精煉業務知識手冊。
- 其他元數據:收單國和商家類別代碼(MCCs)的表格。
任務難度與泛化能力
DABStep 將任務分為兩個難度等級,以提供代理能力的細緻視圖:
- 簡單級別:這些作為熱身,僅需要單一結構化數據集和最少的上下文。Llama 70B 零射提示在這些任務上的準確率可超過 90%。
- 困難級別:這些需要多個結構化數據集和領域特定知識。這些任務需要多步驟歸納推理和迭代程式碼生成。
為防止「幸運猜測」並確保核心推理的可重複性,該基準透過時間範圍和商家名稱的排列組合來爆炸任務基數,採用 符號推理。它也使用 保留測試集 來評估代理在初始版本未涵蓋的分析任務上的泛化能力。
效能基準與模型分析
在困難任務集上的初步評估顯示,即使是最先進的推理模型也難以應對複雜的數據分析。
準確率結果
- o3-mini:16% 準確率(表現最佳)。
- DeepSeek R1:13% 準確率。
- Claude 3.5 Sonnet:12% 準確率。
- DeepSeek V3:6% 準確率。
技術觀察
研究人員發現,推理模型(如 o1 和 R1)在使用標準 ReAct 提示時表現不佳(準確率 0%),而該提示對聊天模型效果良好。這些模型需要專門的「推理提示」才能有效運作。常見的失敗模式包括無效的程式碼語法、指令遵循不良以及無法執行序列步驟。
成本效益權衡
對商業供應的分析顯示這些代理具有不同的經濟性:
- o1 為最昂貴的選項,完整基準花費 435 美元(每任務 0.967 美元)。
- DeepSeek R1 和 GPT-4o-mini 為最具成本效益的選項,完整基準花費 3 美元(每任務 0.007 美元)。
- 研究人員指出,DeepSeek R1 提供了理想的經濟性能比,其低成本下仍具高效能。
DABStep 的未來路線圖
Hugging Face 與 Adyen 計畫隨著 AI 模型的提升而演進基準,以保持其有效性。未來的擴充包括:
- 擴充任務範圍:超越詐騙與費用,延伸至核准率、認證流失和季節性成分。
- 跨域應用:納入健康、生物學、保險和電信領域的數據集。
- 增加數據規模:引入超出記憶體限制的數據集,因而需要使用分散式計算引擎。
- 複雜文件:加入 PDF 格式和版本化邏輯,以測試內容視窗限制。
- 多模態能力:加入需要解讀和繪製圖表的任務。