TAG-Research/TAG-Bench

TAG-Bench: A benchmark for table-augmented generation (TAG)

해결하는 문제

표준 Text2SQL 및 RAG 방법은 데이터베이스 상의 자연어 질문에 답변할 때, 데이터베이스 내부에 명시적으로 포함되지 않은 세계 지식이나 의미적 추론이 필요한 쿼리에 한계가 있습니다.

작동 방식

이 프로젝트는 언어 모델과 데이터베이스 간의 더 복잡한 상호작용을 가능하게 하는 Table-Augmented Generation (TAG)이라는 패러다임을 도입합니다. BIRD 벤치마크에서 유도된 80개의 쿼리로 구성된 벤치마크(TAG v1)를 제공하며, 파라미터 지식이 필요한 40개와 추론이 필요한 40개로 나뉩니다. 이 벤치마크는 수작업 TAG, Text2SQL, RAG, Retrieval + LM Rank 등의 다양한 방법의 정확도와 지연 시간을 측정합니다.

대상 사용자

AI와 데이터베이스의 교차 분야에서 일하는 연구자 및 개발자로, 특히 LLM이 구조화된 데이터에 대해 복잡한 질의를 답변하는 방식을 개선하고자 하는 사람들을 대상으로 합니다.

주요 특징

  • Table-Augmented Generation 문제를 연구하기 위해 특별히 설계된 최초의 벤치마크.
  • 단순한 데이터베이스 검색을 넘어서 세계 지식과 의미적 추론이 필요한 쿼리에 초점을 맞춥니다.
  • TAG를 Text2SQL 및 RAG와 비교하기 위한 포괄적인 평가 세트를 포함합니다.
  • BIRD Text2SQL 벤치마크를 기반으로 구축되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트