GraphRAG-Bench/GraphRAG-Benchmark

The official repo of GraphRAG-Bench for evaluating GraphRAG models. "When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation". (ICLR'26)

What it solves

GraphRAG-Bench は、Graph Retrieval-Augmented Generation(GraphRAG)が従来の RAG を実際に上回るタイミングが不明瞭であるという課題を解決します。GraphRAG は階層構造や複雑な推論を得意としますが、実務タスクではしばしば標準的な RAG に劣ります。本ベンチマークは、グラフ構造が測定可能な利益をもたらす具体的なシナリオと条件を体系的に特定する手段を提供します。

How it works

本プロジェクトは、グラフ構築・知識検索から最終生成までのフルパイプラインをテストする包括的評価フレームワークを提供します。2 つのドメイン(文学/フィクション と 医療/ヘルスケア)にまたがる難易度が上がるタスク群を含むデータセットを使用し、以下の 4 つの次元でパフォーマンスを測定します。

  1. Fact Retrieval: 基本的な正確性と ROUGE-L。
  2. Complex Reasoning: 異なる情報片を結びつける能力。
  3. Contextual Summarization: 要約の正確性とカバレッジ。
  4. Creative Generation: 生成タスクにおける事実スコアとカバレッジ。

Who it’s for

このツールは、RAG システムを構築する AI 研究者や開発者向けで、特定のデータとユースケースに対してグラフベースのアプローチが従来のベクトルベースのアプローチより効果的かどうかを判断する必要がある人に最適です。

Highlights

  • Multi-level Difficulty: タスクはシンプルな事実検索から複雑な創造的生成まで幅広くカバー。
  • Domain-Specific Leaderboards: 医療と文学の両コンテンツ向けに専用ベンチマークを提供。
  • Full-Pipeline Evaluation: 標準化された評価コードにより、異なる GraphRAG フレームワーク間の公平な比較を実現。
  • Framework Support: 各種 GraphRAG フレームワークの統合と評価のための手順とサンプルを提供。