VectifyAI/PageIndex

📑 PageIndex: Document Index for Vectorless, Reasoning-based RAG

What it solves

PageIndex は、従来のベクトルベースの RAG (Retrieval-Augmented Generation) に見られる精度と説明可能性の問題を解決します。言い回しは似ているがクエリに対して無関係な結果を返す可能性があるセマンティック・シミラリティ(意味的類似性)に頼るのではなく、PageIndex は、長文の専門的な文書に対して、推論ベースの検索を通じて真の関連性を追求します。

How it works

PageIndex は、ベクトルデータベースと人工的なチャンク分割を、階層的なツリーインデックスに置き換えます。プロセスは主に 2 つのステップで行われます:

  1. Tree Index Generation: 長文の文書(PDF や Markdown ファイルなど)を意味的な "Table-of-Contents" ツリー構造に変換し、内容を自然なセクションに整理します。任意のチャンクに分割するのではなく、自然な構成要素として整理します。

  2. Reasoning-based Retrieval: LLM を使用してエージェント的なツリー検索を実行し、人間が専門家のように文書をナビゲートして特定の情報を探す方法をシミュレートします。これにより、検索プロセスが追跡可能になり、明示的なページ番号やセクション参照に基づいた結果が得られます。

Who it’s for

金融報告書、法的文書、規制文書、技術マニュアル、学術教科書など、複雑で長文の専門的な文書を扱うユーザー向けに設計されています。

Highlights

  • Vectorless Architecture: ベクトルデータベースの必要性と、チャンク分割戦略の複雑さを排除します。

  • High Accuracy: 金融文書 QA のベンチマークである FinanceBench において、 98.7% の精度を達成しました。

  • Traceable Results: すべての検索は推論に基づき、特定の文書参照に基づいているため、"vibe retrieval"(感覚的な検索)を回避します。

  • Context-Aware: 検索は会話の履歴やドメイン知識に基づいて適応します。

  • Flexible Deployment: セルフホスト型のオープンソースツール、API/MCP 経由のクラウドサービス、またはエンタープライズ展開が可能です。