TAG-Research/TAG-Bench

TAG-Bench: A benchmark for table-augmented generation (TAG)

解决的问题

它解决了标准 Text2SQL 和 RAG 方法在回答数据库上的自然语言问题时的局限性,特别是当查询需要数据库本身未明确包含的世界知识或语义推理时。

工作原理

该项目引入了 Table-Augmented Generation (TAG) 模式,允许语言模型与数据库之间进行更复杂的交互。它提供了一个基准(TAG v1),包含从 BIRD 基准中衍生出的 80 个查询,分为需要参数化知识的 40 个查询和需要推理的 40 个查询。该基准评估了多种方法,包括手写 TAG、Text2SQL、RAG 和 Retrieval + LM Rank,以衡量准确性和延迟。

适用人群

在人工智能与数据库交叉领域工作的研究人员和开发者,特别是希望改进 LLM 与结构化数据交互以进行复杂查询回答的人。

亮点

  • 首个专门用于研究 Table-Augmented Generation 问题的基准。
  • 专注于需要超越简单数据库检索的世界知识和语义推理的查询。
  • 包含全面的评估套件,用于比较 TAG 与 Text2SQL 和 RAG。
  • 基于 BIRD Text2SQL 基准构建。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目