onyx-dot-app/EnterpriseRAG-Bench

Dataset and benchmark for RAG on company internal documents.

What it solves

大多數檢索增強生成(RAG)基準依賴 Wikipedia 或 Stack Overflow 等公開資料。此專案提供一個真實的大規模資料集,專門用於模擬公司內部知識,使開發者能在實際企業環境中常見的雜亂、碎片化、術語密集的資料上,對 RAG 系統進行基準測試並微調代理。

How it works

專案圍繞一個名為 「Redwood Inference」 的模擬公司展開。它提供超過 500,000 份文件,涵蓋 Slack、Gmail、Google Drive、Jira、Confluence 等九類常見企業來源。為確保真實性,資料集加入了以下特性:

  • Cross-document coherence:文件共享公司計畫與員工目錄等共同基礎。
  • Realistic noise:資料包含過時資訊、誤歸檔文件以及相互衝突的事實。
  • Internal terminology:使用專案代號和公司專有縮寫。
  • Diverse Question Set:500 條依難度與類型分類的問題,範圍從簡單事實查詢到跨多文件的複雜推理或處理衝突資訊。

Who it’s for

面向為企業構建 RAG 系統或 AI 代理的 AI 工程師與研究人員,協助他們在內部企業資料上測試檢索準確性與推理能力。

Highlights

  • Massive Scale:超過 500,000 份文件,模擬完整的企業生態系統。
  • Multi-Source Simulation:涵蓋 CRM(Hubspot)、專案管理(Linear)與會議轉錄(Fireflies)等多種工具。
  • Complex Evaluation:包含衝突資訊、文件內推理以及 “info not found” 情境的專門測試案例。
  • Dataset Generator:提供程式碼,可為不同產業或公司規模生成類似的合成資料集。