rahulnyk/knowledge_graph

Convert any text to a graph of knowledge. This can be used for Graph Augmented Generation or Knowledge Graph based QnA

何を解決するか

このプロジェクトは、テキストコーパス(たとえばPDF)を概念の構造化された知識グラフに変換します。単なるエンティティ抽出を超えて、意味のある概念とその関係を捉えることを目指し、テキストの分析やGraph Retrieval Augmented Generation (GRAG)の実装をより深く行う方法を提供します。

動作方法

システムは以下のパイプラインでテキストを処理します:

  1. チャンキング:テキストが小さなセグメントに分割されます。
  2. 概念抽出:ローカルLLM(Ollama経由のMistral 7B)が各チャンクから概念とその意味的関係を抽出します。
  3. 関係マッピング:LLMが特定した明示的な意味的関係と、文脈的な近接性(同じチャンクに出現する概念)に基づいてエッジが作成されます。
  4. 重み付けと集約:類似するペアがグループ化され、重みが合算され、関係が連結されて、異なる概念間の単一のエッジが作成されます。
  5. 分析と可視化:ツールはノードの次数とコミュニティを計算し、サイズと色分けに使用し、NetworkXとPyvisを使用してインタラクティブなウェブベースの可視化を生成します。

対象ユーザー

非構造化テキストをアイデアの視覚的ネットワークに変換したいユーザー、研究者が作品内の概念のつながりを分析したい場合、およびローカルでコスト効率の良いLLMを使用してGraph RAGシステムを構築したい開発者。

特徴

  • ローカル実行:OllamaとMistral 7Bを使用して、プロセスが無料で個人のマシン上で完全に実行されることを保証します。
  • 概念中心:単なる名前付きエンティティではなく、「概念」を抽出することで、より意味のあるグラフを生成します。
  • インタラクティブな可視化:JavaScriptベースのグラフを生成し、ウェブ上でホスティングできます。
  • グラフ解析:中心性とコミュニティの計算をサポートし、テキスト内の最も重要な概念やクラスタを特定できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch