TAG-Research/TAG-Bench

TAG-Bench: A benchmark for table-augmented generation (TAG)

解決的問題

它解決了標準 Text2SQL 和 RAG 方法在回答資料庫上的自然語言問題時的限制,特別是當查詢需要資料庫本身未明確包含的世界知識或語義推理時。

工作原理

本項目引入了 Table-Augmented Generation (TAG) 模式,允許語言模型與資料庫之間進行更複雜的互動。它提供了一個基準(TAG v1),包含從 BIRD 基準中衍生出的 80 個查詢,分為需要參數化知識的 40 個查詢和需要推理的 40 個查詢。該基準評估了多種方法,包括手寫 TAG、Text2SQL、RAG 和 Retrieval + LM Rank,以衡量準確性和延遲。

適用對象

在人工智慧與資料庫交叉領域工作的研究人員和開發者,特別是希望改進 LLM 與結構化資料互動以進行複雜查詢回答的人。

亮點

  • 首個專門用於研究 Table-Augmented Generation 問題的基準。
  • 專注於需要超越簡單資料庫檢索的世界知識和語義推理的查詢。
  • 包含全面的評估套件,用於比較 TAG 與 Text2SQL 和 RAG。
  • 基於 BIRD Text2SQL 基準建構。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案