robert-mcdermott/ai-knowledge-graph

AI Powered Knowledge Graph Generator

解決的問題

本專案自動化將非結構化文字文件轉換為結構化、可互動知識圖譜的流程。它消除了手動識別文字中實體及其關係的勞力,讓使用者能視覺化複雜的連結,並使用 LLM 來查詢產生的資料。

作法

此系統遵循多階段流程:

  1. 提取:將輸入文字(PDF、DOCX、Markdown 等)分割成片段,並使用 LLM 提取主語-謂語-賓語(SPO)三元組,包含實體類型(例如:人物、組織、技術)。
  2. 標準化:使用決定性規則與可選的 LLM 作業,合併相同實體的不同變體(例如:大小寫或複數形式)。
  3. 推論:使用基於 LLM 的橋接與中心節點擴充,以及分類規則,連結圖譜中孤立的部分,並加入知名關係。
  4. 視覺化與查詢:產生一個自包含的 HTML 檔案,供互動式探索。使用者也可使用 graph-chat 命令或本地 Web 伺服器(graph-serve)提問,答案僅基於圖譜中儲存的事實生成。

適用對象

  • 需要對大量文件中的複雜關係進行繪製的研究人員與分析師。
  • 希望以視覺化、可追蹤方式探索從文字中提取知識的使用者。
  • 尋找工具將非結構化文字轉換為 JSON、CSV、GraphML 或 Neo4j 用 Cypher 格式的開發者。

特色

  • 廣泛的輸入支援:支援 .txt.md.rst.pdf.docx 檔案,適用於任何語言。
  • 可追蹤的答案:聊天功能提供有根據的回應,並附上原始來源句子或所用推論方法的引用。
  • 彈性的 LLM 整合:支援任何 OpenAI 相容端點,包含本地選項如 Ollama 和 LM Studio。
  • 互動式探索器:產生包含搜尋、社群檢測與最短路徑查找功能的獨立 HTML 檔案。

相關

  • 專案
  • 專案
  • 專案
  • 專案