GraphRAG-Bench/GraphRAG-Benchmark
The official repo of GraphRAG-Bench for evaluating GraphRAG models. "When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation". (ICLR'26)
What it solves
GraphRAG-Bench는 Graph Retrieval-Augmented Generation(GraphRAG)이 실제로 기존 RAG보다 언제 더 우수한지에 대한 불명확성을 해결합니다. GraphRAG는 계층 구조와 복잡한 추론을 더 잘 처리하도록 설계되었지만, 실제 작업에서는 종종 일반 RAG보다 성능이 떨어집니다. 이 벤치마크는 그래프 구조가 측정 가능한 이점을 제공하는 구체적인 시나리오와 조건을 체계적으로 식별하는 방법을 제공합니다.
How it works
이 프로젝트는 그래프 구축·지식 검색부터 최종 생성까지 전체 파이프라인을 테스트하는 포괄적인 평가 프레임워크를 제공합니다. 두 도메인(문학/소설 및 의료/헬스케어)에서 난이도가 점진적으로 증가하는 작업을 포함한 데이터셋을 활용하며, 다음 네 가지 차원에서 성능을 측정합니다.
- Fact Retrieval: 기본 정확도와 ROUGE-L.
- Complex Reasoning: 서로 다른 정보 조각을 연결하는 능력.
- Contextual Summarization: 요약의 정확도와 커버리지.
- Creative Generation: 생성 작업에 대한 사실 점수와 커버리지.
Who it’s for
이 도구는 RAG 시스템을 구축하는 AI 연구자와 개발자를 위한 것으로, 특정 데이터와 사용 사례에 대해 그래프 기반 접근 방식이 기존 벡터 기반 접근 방식보다 더 효과적인지 판단해야 하는 경우에 적합합니다.
Highlights
- Multi-level Difficulty: 작업은 간단한 사실 검색부터 복잡한 창의적 생성까지 다양합니다.
- Domain-Specific Leaderboards: 의료와 문학 콘텐츠 모두를 위한 전용 벤치마크를 포함합니다.
- Full-Pipeline Evaluation: 표준화된 평가 코드를 통해 다양한 GraphRAG 프레임워크 간의 공정한 비교를 보장합니다.
- Framework Support: 다양한 GraphRAG 프레임워크를 통합하고 평가하기 위한 지침과 예제를 제공합니다.