oomol-lab/spinedigest

distill any book down to its spine

解决的问题

Wiki Graph 解决了为 LLM 管理长文本知识库的挑战。它不是强迫 AI 为每个查询从头开始处理原始素材,而是将长文本编译成持久、可维护且可追溯的知识库。这避免了重复提取的需要,并通过将知识锚定在公开实体和可验证的源证据中来减少幻觉。

工作原理

使用 CLI 将长文本处理为 .wikg 存档。系统通过 WikiSpine 主要将实体与来自 Wikipedia 和 Wikidata 的公开实体进行对齐,从而从文本中提取实体和关系(三元组)。通过使用共享的公开词典而不是依赖私有的、不断演变的模式,确保了稳定性。

核心组件包括:

  • Knowledge Graph:一个由实体和三元组 (subject --predicate--> object) 组成的网络,允许用户浏览相关概念。
  • Evidence Tracking:每个实体和关系都链接回源文本中的特定章节和原始句子,以便进行验证。
  • Reading Graph:对于摘要,该工具将文本分解为认知块,并按相关性将它们连接起来,以生成可追溯到源的压缩摘要。
  • URI System:一种稳定的句柄系统(例如 wikg://archive/entity/QID),用于对知识库中的特定范围或对象进行寻址和操作。

适用对象

专为构建 AI Agent 工作流的开发人员设计,这些工作流需要摄取大量文本(PDF、EPUB、网页等)并将其转换为结构化、可搜索且可验证的知识库。

亮点

  • 源可追溯性:每条提取的知识都可以追溯到原始源句子。
  • 公开实体对齐:使用 Wikidata/Wikipedia QID 确保在不同文档中实现一致的实体识别。
  • 便携式存档:将所有内容存储在可以共享、备份或移动的 .wikg 文件中。
  • 结构化导航:允许通过实体和关系的图谱而不是仅仅通过关键词搜索来查询知识库。