oomol-lab/wiki-graph
distill any book down to its spine
它解决了什么
LLMs 在处理大量源材料时常常遇到困难,需要为每个查询从头重新读取原始数据。Wiki Graph 通过将长文本编译成一个可维护的、结构化的知识库(即 “LLM Wiki” 概念)来解决这个问题,该知识库保留了实体、关系以及直接指向原始来源的证据。
它是如何工作的
该工具使用 CLI 摄取文本(来自 PDF、EPUB、网页等),并将其存储在自定义的 .wikg 归档格式中。它利用 LLM 提取实体——通过 WikiSpine 与 Wikipedia/Wikidata 等公共数据集对齐——以及从文本中提取关系(三元组)。它还通过将文本分块并连接概念上相关的片段来构建“阅读图”,从而能够生成仍可追溯到原始源句子的摘要。
它适用于谁
- AI 开发者 构建需要稳定、可验证知识检索的代理工作流。
- 知识工作者 希望将长文档转换为可搜索、结构化且便携的知识库。
- 研究人员 需要将特定声明或实体追溯到其确切的源章节和句子。
亮点
- 可追溯的知识图谱: 生成包含直接指向源文本证据链接的实体和关系的结构化网络。
- 便携的
.wikg格式: 使用专门的归档格式将源文本、章节树和知识图存储在单个可共享的文件中。 - 公共实体对齐: 使用 Wikipedia/Wikidata QIDs 为提取的实体提供稳定的语义边界。
- 上下文打包: 包含一个
pack命令,可将特定的块或实体转换为便携文本,用于 LLM 提示。 - 基于 URI 的导航: 采用独特的 URI 系统,在归档内导航和查询特定范围、章节或实体。