GraphRAG-Bench/GraphRAG-Benchmark

The official repo of GraphRAG-Bench for evaluating GraphRAG models. "When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation". (ICLR'26)

What it solves

GraphRAG-Bench 解决了关于 Graph Retrieval-Augmented Generation(GraphRAG)何时真正优于传统 RAG 的模糊问题。虽然 GraphRAG 设计上能更好地处理层级结构与复杂推理,但在实际任务中常常不如普通 RAG。此基准提供了一套系统化的方法,找出图结构能带来可衡量效益的具体情境与条件。

How it works

此项目提供一个完整的评估框架,测试模型在整个流程中的表现——从图形构建、知识检索到最终生成。它使用一套数据集,包含两个领域(文学/小说与医疗/健康)的递增难度任务,并在四个维度上衡量性能:

  1. Fact Retrieval:基本准确度与 ROUGE-L。
  2. Complex Reasoning:连接不同信息片段的能力。
  3. Contextual Summarization:摘要的准确性与覆盖率。
  4. Creative Generation:生成任务的事实分数与覆盖率。

Who it’s for

此工具适用于构建 RAG 系统的 AI 研究者和开发者,帮助他们判断在特定数据与使用场景下,图形化方法是否比传统向量化方法更有效。

Highlights

  • Multi-level Difficulty:任务范围从简单事实检索到复杂创意生成。
  • Domain-Specific Leaderboards:提供医疗与文学两大领域的专属基准。
  • Full-Pipeline Evaluation:标准化的评估代码,确保不同 GraphRAG 框架之间的公平比较。
  • Framework Support:提供整合与评估各种 GraphRAG 框架的说明与示例。