onyx-dot-app/EnterpriseRAG-Bench
Dataset and benchmark for RAG on company internal documents.
What it solves
대부분의 Retrieval Augmented Generation (RAG) 벤치마크는 Wikipedia나 Stack Overflow와 같은 공개 데이터를 사용합니다. 이 프로젝트는 기업 내부 지식을 시뮬레이션하도록 설계된 현실적이고 대규모 데이터셋을 제공합니다. 개발자는 실제 엔터프라이즈 환경에서 발견되는 복잡하고 파편화된, 전문 용어가 많은 데이터를 대상으로 RAG 시스템을 벤치마크하고 에이전트를 파인튜닝할 수 있습니다.
How it works
프로젝트는 "Redwood Inference"라는 가상의 회사를 중심으로 구성됩니다. Slack, Gmail, Google Drive, Jira, Confluence 등 9가지 일반적인 엔터프라이즈 소스에 걸쳐 500,000개 이상의 문서 코퍼스를 제공합니다. 현실성을 높이기 위해 데이터셋에는 다음이 포함됩니다.
- Cross-document coherence: 문서들은 회사 이니셔티브와 직원 디렉터리라는 공통 기반을 공유합니다.
- Realistic noise: 오래된 정보, 잘못 분류된 문서, 상충되는 사실이 포함됩니다.
- Internal terminology: 프로젝트 코드명 및 회사 고유 약어가 사용됩니다.
- Diverse Question Set: 난이도와 유형별로 분류된 500개의 질문이 있으며, 간단한 사실 조회부터 여러 문서를 아우르는 복합 추론, 상충 정보 처리까지 다양합니다.
Who it’s for
엔터프라이즈 환경에서 RAG 시스템이나 AI 에이전트를 구축하는 AI 엔지니어 및 연구자들을 위한 것으로, 내부 기업 데이터에 대한 검색 정확도와 추론 능력을 고충실도 환경에서 테스트하고자 하는 사람들을 대상으로 합니다.
Highlights
- Massive Scale: 500,000개 이상의 문서로 전체 기업 생태계를 시뮬레이션합니다.
- Multi-Source Simulation: CRM(Hubspot), 프로젝트 관리(Linear), 회의 전사(Fireflies) 등 다양한 도구를 포괄합니다.
- Complex Evaluation: 상충 정보, 문서 내 추론, "info not found" 시나리오에 대한 구체적인 테스트 케이스를 포함합니다.
- Dataset Generator: 다른 산업이나 기업 규모에 맞는 유사 합성 데이터셋을 생성할 수 있는 코드를 제공합니다.