TAG-Research/TAG-Bench
TAG-Bench: A benchmark for table-augmented generation (TAG)
何を解決するか
標準的な Text2SQL および RAG メソッドでは、データベース上の自然言語質問に回答する際に、データベース自体に明示的に含まれていない世界知識や意味的推論を必要とするクエリに対して限界があります。
仕組み
本プロジェクトは、言語モデルとデータベース間のより複雑な相互作用を可能にするパラダイムである Table-Augmented Generation (TAG) を導入します。TAG v1 と呼ばれるベンチマークを提供しており、BIRD ベンチマークから導出された 80 クエリで構成され、パラメトリック知識を必要とする 40 クエリと推論を必要とする 40 クエリに分かれています。このベンチマークは、手書き TAG、Text2SQL、RAG、Retrieval + LM Rank などのさまざまな手法の正確性と遅延を測定します。
対象ユーザー
AI とデータベースの交差点で作業している研究者や開発者。特に、LLM が構造化データに対して複雑なクエリを回答する方法を改善したい人向けです。
特徴
- Table-Augmented Generation 問題を研究するために特化した最初のベンチマーク。
- 単純なデータベース検索を超えた世界知識と意味的推論を必要とするクエリに焦点を当てています。
- TAG と Text2SQL、RAG を比較するための包括的な評価スイートを含みます。
- BIRD Text2SQL ベンチマークに基づいて構築されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト