PageIndex: 複雑なドキュメント向けに類似検索を理由付けベースのツリー検索に置き換えるベクトルレスRAGエンジン

それが解決すること

従来のベクトルベースのRetrieval-Augmented Generation(RAG)は、意味的類似性に依存することが多く、複雑で専門的なドキュメントでは本当に関連性の高い情報を見つけられないことがあります。PageIndexは、類似性ベースの検索を理由付けベースの検索に置き換えることでこの問題に対処し、単なる似たようなテキストではなく、関連性と文脈理解に基づいて情報を見つけることを保証します。

どうやって動作するか

PageIndexは、長いドキュメントを人工的なチャンクに分割する代わりに、階層的なツリー構造インデックス(詳細な目次に似たもの)に変換します。その後、LLMを使用してエージェンティックツリー検索を実行し、インデックスを理由付けながらドキュメントの最も関連性の高いセクションにナビゲートします。このプロセスは、人間の専門家が複雑なファイルを読み取りナビゲートする方法を反映しており、検索プロセスを追跡可能かつ説明可能にします。

誰のためのものか

これは、財務報告書、法務提出書類、規制文書、技術マニュアル、学術教科書などの長く複雑な専門ドキュメントを扱うユーザー向けに設計されています。

ハイライト

  • ベクトルレスRAG: ベクトルデータベースとチャンク分割の必要性をなくします。
  • 理由付け駆動: コンテキストを意識した検索のためにLLMベースのツリー検索を使用します。
  • 高い精度: FinanceBenchベンチマークで98.7%の精度を達成しました。
  • 追跡可能な結果: 説明性を高めるために、明示的なページおよびセクション参照に基づいています。
  • 柔軟なデプロイメント: セルフホスト型オープンソースツール、クラウドサービス、またはエンタープライズデプロイメントとして利用可能です。

Sources