GraphRAG-Bench/GraphRAG-Benchmark
The official repo of GraphRAG-Bench for evaluating GraphRAG models. "When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation". (ICLR'26)
What it solves
GraphRAG-Bench 解決了關於 Graph Retrieval-Augmented Generation(GraphRAG)何時真正優於傳統 RAG 的模糊問題。雖然 GraphRAG 設計上能更好地處理階層結構與複雜推理,但在實際任務中常常不如普通 RAG。此基準提供了一套系統化的方法,找出圖結構能帶來可衡量效益的具體情境與條件。
How it works
此專案提供一個完整的評估框架,測試模型在整個流程中的表現——從圖形建構、知識檢索到最終生成。它使用一套資料集,包含兩個領域(文學/小說與醫療/健康)的遞增難度任務,並在四個維度上衡量效能:
- Fact Retrieval:基本準確度與 ROUGE-L。
- Complex Reasoning:連結不同資訊片段的能力。
- Contextual Summarization:摘要的準確性與覆蓋率。
- Creative Generation:生成任務的事實分數與覆蓋率。
Who it’s for
此工具適用於構建 RAG 系統的 AI 研究者與開發者,幫助他們判斷在特定資料與使用情境下,圖形化方法是否比傳統向量化方法更有效。
Highlights
- Multi-level Difficulty:任務範圍從簡單事實檢索到複雜創意生成。
- Domain-Specific Leaderboards:提供醫療與文學兩大領域的專屬基準。
- Full-Pipeline Evaluation:標準化的評估程式碼,確保不同 GraphRAG 框架之間的公平比較。
- Framework Support:提供整合與評估各種 GraphRAG 框架的說明與範例。