oomol-lab/wiki-graph

distill any book down to its spine

它解决了什么

LLMs 在处理大量源材料时常常遇到困难,需要为每个查询从头重新读取原始数据。Wiki Graph 通过将长文本编译成一个可维护的、结构化的知识库(即 “LLM Wiki” 概念)来解决这个问题,该知识库保留了实体、关系以及直接指向原始来源的证据。

它是如何工作的

该工具使用 CLI 摄取文本(来自 PDF、EPUB、网页等),并将其存储在自定义的 .wikg 归档格式中。它利用 LLM 提取实体——通过 WikiSpine 与 Wikipedia/Wikidata 等公共数据集对齐——以及从文本中提取关系(三元组)。它还通过将文本分块并连接概念上相关的片段来构建“阅读图”,从而能够生成仍可追溯到原始源句子的摘要。

它适用于谁

  • AI 开发者 构建需要稳定、可验证知识检索的代理工作流。
  • 知识工作者 希望将长文档转换为可搜索、结构化且便携的知识库。
  • 研究人员 需要将特定声明或实体追溯到其确切的源章节和句子。

亮点

  • 可追溯的知识图谱: 生成包含直接指向源文本证据链接的实体和关系的结构化网络。
  • 便携的 .wikg 格式: 使用专门的归档格式将源文本、章节树和知识图存储在单个可共享的文件中。
  • 公共实体对齐: 使用 Wikipedia/Wikidata QIDs 为提取的实体提供稳定的语义边界。
  • 上下文打包: 包含一个 pack 命令,可将特定的块或实体转换为便携文本,用于 LLM 提示。
  • 基于 URI 的导航: 采用独特的 URI 系统,在归档内导航和查询特定范围、章节或实体。