VectifyAI/PageIndex

📑 PageIndex: Document Index for Vectorless, Reasoning-based RAG

What it solves

PageIndex 解决了传统基于向量的检索增强生成 (RAG) 中存在的准确性和可解释性问题。PageIndex 不依赖于语义相似度——这可能会返回措辞相似但与查询无关的结果——而是通过针对长篇专业文档的基于推理的检索,专注于真正的相关性。

How it works

PageIndex 用分层树状索引取代了向量数据库和人工分块 (chunking)。该过程分为两个主要步骤:

  1. Tree Index Generation: 它将长文档(如 PDF 或 Markdown 文件)转换为语义化的 "Table-of-Contents" 树状结构,将内容组织成自然的章节,而不是随意的分块。

  2. Reasoning-based Retrieval: 它使用 LLMs 来执行代理式树状搜索,模拟人类专家如何浏览文档以查找特定信息。这使得检索过程具有可追溯性,并基于明确的页面和章节引用。

Who it’s for

它适用于处理复杂、长篇专业文档的用户,例如财务报告、法律文件、监管文档、技术手册和学术教科书。

Highlights

  • Vectorless Architecture: 消除了对向量数据库的需求以及分块策略的复杂性。
  • High Accuracy: 在 FinanceBench 基准测试中,针对金融文档 QA 的准确率达到了 98.7%。
  • Traceable Results: 每次检索都是推理驱动的,并基于具体的文档引用,避免了 "vibe retrieval"。
  • Context-Aware: 检索会根据对话历史和领域知识进行调整。
  • Flexible Deployment: 可作为自托管开源工具、通过 API/MCP 提供的云服务,或企业级部署。