robert-mcdermott/ai-knowledge-graph

AI Powered Knowledge Graph Generator

何を解決するか

このプロジェクトは、非構造化テキストドキュメントを構造化されたインタラクティブな知識グラフに自動変換するプロセスを自動化します。テキスト内のエンティティとその関係を手動で特定する作業を排除し、ユーザーが複雑な関係を可視化し、LLMを用いて結果のデータをクエリできるようにします。

動作方法

このシステムは複数段階のパイプラインに従います:

  1. 抽出:入力テキスト(PDF、DOCX、Markdownなど)をチャンクに分割し、LLMを使用して主語-述語-目的語(SPO)トリプレットを抽出します。エンティティの種類(例:人物、組織、技術)も含みます。
  2. 標準化:同一エンティティのバリエーション(例:大文字・小文字、複数形)を決定論的ルールとオプションのLLM処理で統合します。
  3. 推論:LLMベースのブリッジングとハブ拡張、および分類ツリー規則を使用して、グラフの孤立した部分を接続し、よく知られた関係を追加します。
  4. 可視化とクエリ:インタラクティブな探索用の自己完結型HTMLファイルを生成します。ユーザーは graph-chat コマンドまたはローカルWebサーバー(graph-serve)を使用して、グラフに格納された事実のみに基づいて質問に答えることができます。

対象ユーザー

  • 大量のドキュメントにおける複雑な関係をマッピングする必要がある研究者やアナリスト。
  • テキストから抽出された知識を視覚的かつ追跡可能な方法で探索したいユーザー。
  • 非構造化テキストをJSON、CSV、GraphML、またはNeo4j用のCypher形式に変換するツールを探している開発者。

特徴

  • 広範な入力対応:任意の言語で .txt.md.rst.pdf.docx ファイルを処理可能。
  • 追跡可能な回答:チャット機能は、元のソース文や推論手法への引用付きで根拠のある回答を提供します。
  • 柔軟なLLM統合:OpenAI互換エンドポイント(OllamaやLM Studioなどのローカルオプションを含む)と連携可能。
  • インタラクティブなエクスプローラー:検索、コミュニティ検出、最短経路探索機能を備えたスタンドアロンHTMLファイルを出力。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト