VectifyAI/PageIndex

📑 PageIndex: Document Index for Vectorless, Reasoning-based RAG

PageIndex – 無向量、基於推理的檢索增強生成

是什麼 – PageIndex 是一個開源的 RAG 引擎,以從文件佈局建立的 階層式樹狀索引 取代傳統的向量儲存 + 分塊流程。查詢時,LLM 會在樹上推理,利用其自身推理能力(以及完整的對話上下文)定位最相關的段落。結果是,無需任何向量資料庫,即可實現 可追蹤、可解釋、具上下文感知 的檢索步驟。


核心概念

概念 PageIndex 的實作方式
索引建立 將 PDF(或其他文字密集型文件)解析為反映文件邏輯結構(章節、段落、標題)的樹。輕量級 LLM 模型(index=)對每個節點進行摘要;樹本身由佈局生成,而非嵌入向量。
檢索 提出問題後,chat 模型(chat=)在樹上進行推理,逐步選擇節點,如同人類讀者一般。模型可看見完整的對話歷史、領域知識與任何外部上下文,因此相關性由推理驅動,而非純粹相似性。
無向量 / 無分塊 由於索引是決定性的樹,無需向量資料庫、相似性搜尋或固定大小的分塊。
可解釋性 模型在樹中行進的路徑可見,可提供清晰的引用(本地為頁面級,雲端為行級)。

快速入門(本機模式)

pip install -U pageindex
import os
from pageindex import PageIndexClient

os.environ["OPENAI_API_KEY"] = "your-openai-key"

client = PageIndexClient(
    index="gpt-5.6-luna",   # 用於建立樹的低成本模型
    chat="gpt-5.6-sol",    # 執行推理搜尋的模型
)

# 上傳 PDF 並取得文件識別碼
doc_id = client.submit_document("report.pdf")['doc_id']

# 提問 – 客戶端會自動為您遍歷樹
answer = client.chat("2023 年的營運利潤率是多少?", doc_id=doc_id)
print(answer)

相同的 SDK 可透過設定 index="cloud" 並提供 PAGEINDEX_API_KEY,用於 PageIndex Cloud。

主要功能

  • 基於樹的索引,反映文件的邏輯層級。
  • LLM 驅動的搜尋:模型決定下一步探索哪個節點,支援多步推理。
  • 本機與雲端模式 – 可在本機部署整個流程,或由 PageIndex 的管理服務處理 OCR、影像理解及大規模語料庫(檔案系統層)。
  • 成本效益高:索引成本 ≈ $0.001/頁;查詢成本與文件長度無關,因為僅將訪問過的節點傳送給模型。
  • 可追蹤引用 – 每個回答均可回溯至精確頁面(本機)或行(雲端)。
  • 即插即用 SDK,支援串流、多文件搜尋,以及 OpenAI/Claude 代理框架的預建工具。

基準測試與效能(如 README 所述)

  • 索引建立 – $0.001/頁,PDF 頁數從 9 到 1,098 頁,耗時 13 秒至 4.5 分鐘。
  • 查詢成本 – 在 52 頁時比將整份 PDF 輸入模型便宜 2.1 倍,在 420 頁時便宜 16.6 倍;超過約 800 頁時,全 PDF 方法會超出上下文視窗。
  • 準確率 – 在 FinanceBench QA 基準測試中,PageIndex 達到 98.7% 的準確率,遠高於向量 RAG 的典型 ~50%。
  • OSS 基準測試 – 附帶的 PageIndex-OSS-Benchmark 倉儲對 34 份 PDF(共 1,945 頁)中的 62 個查找問題進行評估,展現模型大小與每查詢成本之間的清晰權衡曲線。

典型使用情境

  • 財務報告、監管申報、法律合約 – 相關性依賴領域知識與多步推理。
  • 技術手冊與醫學文獻 – 長篇結構化文件,需精確引用。
  • 企業知識庫 – 尤其適用於無需管理向量資料庫即可實現可解釋檢索的場景。

授權與貢獻

此倉儲為開源專案(README 未列出特定授權,請查看倉儲中的 LICENSE 檔案)。歡迎透過拉取請求貢獻程式碼;專案亦提供商業雲服務,用於 OCR、影像理解及大規模索引。

更多資訊


PageIndex 讓您像人類閱讀一樣從巨大而複雜的 PDF 中檢索資訊,無需向量或不透明的相似性分數的開銷。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案