robert-mcdermott/ai-knowledge-graph

AI Powered Knowledge Graph Generator

解决的问题

该项目自动化将非结构化文本文档转换为结构化、可交互的知识图谱的过程。它消除了手动识别文本中实体及其关系的工作,使用户能够可视化复杂连接,并使用 LLM 查询生成的数据。

工作原理

该系统遵循多阶段流水线:

  1. 提取:将输入文本(PDF、DOCX、Markdown 等)分割为块,并使用 LLM 提取主语-谓语-宾语(SPO)三元组,包括实体类型(如人物、组织、技术)。
  2. 标准化:使用确定性规则和可选的 LLM 处理,合并同一实体的不同变体(如大小写或复数形式)。
  3. 推理:使用基于 LLM 的桥接和中心节点增强,以及分类规则,连接图谱中孤立的部分,并添加已知关系。
  4. 可视化与查询:生成一个自包含的 HTML 文件用于交互式探索。用户还可以使用 graph-chat 命令或本地 Web 服务器(graph-serve)提问,答案仅基于图谱中存储的事实生成。

适用人群

  • 需要对大量文档中的复杂关系进行映射的研究人员和分析师。
  • 希望以可视化、可追溯方式探索从文本中提取知识的用户。
  • 寻找工具将非结构化文本转换为 JSON、CSV、GraphML 或 Neo4j 用 Cypher 格式的开发者。

亮点

  • 广泛输入支持:支持 .txt.md.rst.pdf.docx 文件,适用于任何语言。
  • 可追溯的答案:聊天功能提供基于原始来源句子或所用推理方法的有依据的回答。
  • 灵活的 LLM 集成:兼容任何 OpenAI 兼容端点,包括本地选项如 Ollama 和 LM Studio。
  • 交互式探索器:生成包含搜索、社区检测和最短路径查找功能的独立 HTML 文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目