TAG-Research/TAG-Bench
TAG-Bench: A benchmark for table-augmented generation (TAG)
해결하는 문제
표준 Text2SQL 및 RAG 방법은 데이터베이스 상의 자연어 질문에 답변할 때, 데이터베이스 내부에 명시적으로 포함되지 않은 세계 지식이나 의미적 추론이 필요한 쿼리에 한계가 있습니다.
작동 방식
이 프로젝트는 언어 모델과 데이터베이스 간의 더 복잡한 상호작용을 가능하게 하는 Table-Augmented Generation (TAG)이라는 패러다임을 도입합니다. BIRD 벤치마크에서 유도된 80개의 쿼리로 구성된 벤치마크(TAG v1)를 제공하며, 파라미터 지식이 필요한 40개와 추론이 필요한 40개로 나뉩니다. 이 벤치마크는 수작업 TAG, Text2SQL, RAG, Retrieval + LM Rank 등의 다양한 방법의 정확도와 지연 시간을 측정합니다.
대상 사용자
AI와 데이터베이스의 교차 분야에서 일하는 연구자 및 개발자로, 특히 LLM이 구조화된 데이터에 대해 복잡한 질의를 답변하는 방식을 개선하고자 하는 사람들을 대상으로 합니다.
주요 특징
- Table-Augmented Generation 문제를 연구하기 위해 특별히 설계된 최초의 벤치마크.
- 단순한 데이터베이스 검색을 넘어서 세계 지식과 의미적 추론이 필요한 쿼리에 초점을 맞춥니다.
- TAG를 Text2SQL 및 RAG와 비교하기 위한 포괄적인 평가 세트를 포함합니다.
- BIRD Text2SQL 벤치마크를 기반으로 구축되었습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트