VectifyAI/PageIndex
📑 PageIndex: Document Index for Vectorless, Reasoning-based RAG
PageIndex – 無向量、基於推理的檢索增強生成
是什麼 – PageIndex 是一個開源的 RAG 引擎,以從文件佈局建立的 階層式樹狀索引 取代傳統的向量儲存 + 分塊流程。查詢時,LLM 會在樹上推理,利用其自身推理能力(以及完整的對話上下文)定位最相關的段落。結果是,無需任何向量資料庫,即可實現 可追蹤、可解釋、具上下文感知 的檢索步驟。
核心概念
| 概念 | PageIndex 的實作方式 |
|---|---|
| 索引建立 | 將 PDF(或其他文字密集型文件)解析為反映文件邏輯結構(章節、段落、標題)的樹。輕量級 LLM 模型(index=)對每個節點進行摘要;樹本身由佈局生成,而非嵌入向量。 |
| 檢索 | 提出問題後,chat 模型(chat=)在樹上進行推理,逐步選擇節點,如同人類讀者一般。模型可看見完整的對話歷史、領域知識與任何外部上下文,因此相關性由推理驅動,而非純粹相似性。 |
| 無向量 / 無分塊 | 由於索引是決定性的樹,無需向量資料庫、相似性搜尋或固定大小的分塊。 |
| 可解釋性 | 模型在樹中行進的路徑可見,可提供清晰的引用(本地為頁面級,雲端為行級)。 |
快速入門(本機模式)
pip install -U pageindex
import os
from pageindex import PageIndexClient
os.environ["OPENAI_API_KEY"] = "your-openai-key"
client = PageIndexClient(
index="gpt-5.6-luna", # 用於建立樹的低成本模型
chat="gpt-5.6-sol", # 執行推理搜尋的模型
)
# 上傳 PDF 並取得文件識別碼
doc_id = client.submit_document("report.pdf")['doc_id']
# 提問 – 客戶端會自動為您遍歷樹
answer = client.chat("2023 年的營運利潤率是多少?", doc_id=doc_id)
print(answer)
相同的 SDK 可透過設定 index="cloud" 並提供 PAGEINDEX_API_KEY,用於 PageIndex Cloud。
主要功能
- 基於樹的索引,反映文件的邏輯層級。
- LLM 驅動的搜尋:模型決定下一步探索哪個節點,支援多步推理。
- 本機與雲端模式 – 可在本機部署整個流程,或由 PageIndex 的管理服務處理 OCR、影像理解及大規模語料庫(檔案系統層)。
- 成本效益高:索引成本 ≈ $0.001/頁;查詢成本與文件長度無關,因為僅將訪問過的節點傳送給模型。
- 可追蹤引用 – 每個回答均可回溯至精確頁面(本機)或行(雲端)。
- 即插即用 SDK,支援串流、多文件搜尋,以及 OpenAI/Claude 代理框架的預建工具。
基準測試與效能(如 README 所述)
- 索引建立 – $0.001/頁,PDF 頁數從 9 到 1,098 頁,耗時 13 秒至 4.5 分鐘。
- 查詢成本 – 在 52 頁時比將整份 PDF 輸入模型便宜 2.1 倍,在 420 頁時便宜 16.6 倍;超過約 800 頁時,全 PDF 方法會超出上下文視窗。
- 準確率 – 在 FinanceBench QA 基準測試中,PageIndex 達到 98.7% 的準確率,遠高於向量 RAG 的典型 ~50%。
- OSS 基準測試 – 附帶的
PageIndex-OSS-Benchmark倉儲對 34 份 PDF(共 1,945 頁)中的 62 個查找問題進行評估,展現模型大小與每查詢成本之間的清晰權衡曲線。
典型使用情境
- 財務報告、監管申報、法律合約 – 相關性依賴領域知識與多步推理。
- 技術手冊與醫學文獻 – 長篇結構化文件,需精確引用。
- 企業知識庫 – 尤其適用於無需管理向量資料庫即可實現可解釋檢索的場景。
授權與貢獻
此倉儲為開源專案(README 未列出特定授權,請查看倉儲中的 LICENSE 檔案)。歡迎透過拉取請求貢獻程式碼;專案亦提供商業雲服務,用於 OCR、影像理解及大規模索引。
更多資訊
- 網站 / 文件 – https://pageindex.ai
- SDK 文件 – https://docs.pageindex.ai
- 部落格與基準詳情 – https://pageindex.ai/blog
- GitHub 基準倉儲 – https://github.com/VectifyAI/PageIndex-OSS-Benchmark
PageIndex 讓您像人類閱讀一樣從巨大而複雜的 PDF 中檢索資訊,無需向量或不透明的相似性分數的開銷。
相關
- 專案
- 專案
- 專案
- 專案
- 專案