Ontos-AI/knowhere

Knowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.

何を解決するか

Knowhereは、AIエージェント向けに『汚れた』または複雑な非構造化ドキュメント(PDFやPowerPointスライドなど)を準備する難しさに対処します。従来のRAGは、孤立したスニペットのフラットなベクトル検索や脆弱なOCR/レイアウト抽出に依存するため、ドキュメントの元の構造、読み順、視覚的文脈が失われ、モデルの応答が信頼できない結果を招くことがあります。

動作方法

Knowhereは2段階のプロセスを通じて、永続的でナビゲート可能なメモリシステムにドキュメントを変換します。

  1. 解析とメモリ構築:二重アプローチを採用します。テキストトラックは信頼性の高いテキストドキュメントのネイティブ構造を保持し、ビジュアルトラックは最先端のビジョンモデルを使って複雑なページを包括的に理解します。両トラックは単一の階層ネイティブスキーマに正規化され、ナビゲーションツリー、リンクされたアセット、ドキュメント間の関係を格納します。
  2. エージェント指向の検索:固定パイプラインではなく、Knowhereはツールのコア(アウトライン、構造フィルタ、ファジー検索など)を提供します。AIエージェントはこのメモリを探索する方法を自ら決定します——セクションツリーをたどるか、特定の領域に掘り下げるか——正確な証拠を発見・引用できます。

対象ユーザー

構造的文脈や視覚的証拠が重要な、複雑なローカルまたはオフラインドキュメントコレクションからの高精度検索を必要とするAIエージェントやLLMワークフローを開発する開発者向けに設計されています。

特徴

  • 二重トラック解析:複雑なPDFやスライドに対して、テキストネイティブ抽出とビジュアルベースのページ理解を組み合わせます。
  • 階層ネイティブメモリ:断片化されたチャンクではなく、ドキュメントパス、ページ範囲、セクションノードを保持します。
  • エージェントネイティブ検索:エージェントがドキュメントのセクションツリーとドキュメント間グラフを自律的にナビゲートできるようにします。
  • ページベースの引用:ソースドキュメント、セクションパス、レンダリングされた視覚的証拠を含む、追跡可能な参照を提供します。
  • ドキュメント間メモリグラフ:タイプ付きエンティティとキーワードを使って、名前空間内の関連ドキュメントを接続します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト