onyx-dot-app/EnterpriseRAG-Bench

Dataset and benchmark for RAG on company internal documents.

What it solves

大多数检索增强生成(RAG)基准依赖 Wikipedia 或 Stack Overflow 等公开数据。该项目提供了一个真实的大规模数据集,专门用于模拟公司内部知识,使开发者能够在实际企业环境中常见的混乱、碎片化、术语密集的数据上,对 RAG 系统进行基准测试并微调代理。

How it works

项目围绕一个名为 “Redwood Inference” 的模拟公司展开。它提供了超过 500,000 篇文档,覆盖 Slack、Gmail、Google Drive、Jira、Confluence 等九类常见企业来源。为确保真实性,数据集加入了以下特性:

  • Cross-document coherence:文档共享公司计划和员工目录等共同基础。
  • Realistic noise:数据包含过时信息、误归档文档以及相互冲突的事实。
  • Internal terminology:使用项目代号和公司专有缩写。
  • Diverse Question Set:500 条按难度和类型分类的问题,范围从简单事实查询到跨多文档的复杂推理或处理冲突信息。

Who it’s for

面向为企业构建 RAG 系统或 AI 代理的 AI 工程师和研究人员,帮助他们在内部企业数据上测试检索准确性和推理能力。

Highlights

  • Massive Scale:超过 500,000 篇文档,模拟完整的企业生态系统。
  • Multi-Source Simulation:涵盖 CRM(Hubspot)、项目管理(Linear)和会议转录(Fireflies)等多种工具。
  • Complex Evaluation:包含冲突信息、文档内推理以及 “info not found” 场景的专门测试用例。
  • Dataset Generator:提供代码,可为不同行业或公司规模生成类似的合成数据集。