atomicstrata/llm-wiki-compiler

The knowledge compiler. Raw sources in, interlinked wiki out. Inspired by Karpathy's LLM Wiki pattern.

What it solves

llmwiki 将原始、未结构化的数据(PDF、网页、笔记、转录稿)转化为结构化、相互链接的 Markdown 维基。不同于传统的 RAG(检索增强生成),后者在查询时检索原始片段,llmwiki 在编译时一次性将知识编译成持久、类型化的页面并附带引用。这避免了代理和人类在原始文件中反复重新发现关系,创建一个随时间累积、可审计的稳定知识库。

How it works

系统使用两阶段 LLM 流水线来抽取概念并生成类型化页面(如概念、实体、比较)。它实现了“编译时”知识的理念:将来源摄入并处理成以 YAML front‑matter 存储的 Markdown 文件的维基结构。

关键架构组件包括:

  • Configurable Lifecycle Profiles (CLP): 基于 JSON 的合约,定义实体 schema、关系和信任门槛,确保运行时执行领域特定规则,而不是依赖提示约定。
  • Hybrid Retrieval: 结合语义块搜索、BM25 重排序和 wikilink 图扩展,为查询构建上下文包。
  • Quality Gates: 包含用于校验引用和链接的 lint 系统,以及用于衡量健康分数和引用精度的评估框架。
  • Integration Layers: 提供 CLI、TypeScript SDK 和 MCP(Model Context Protocol)服务器,允许代理与维基交互。

Who it’s for

它面向需要从原始材料构建持久、可审计知识库的用户,例如使用 autosci 模板的研究人员或使用 newsroom 模板的编辑团队,以及构建需要稳定、带引用上下文的 AI 代理的开发者。

Highlights

  • Citation-Traceable Output: 每个声明和段落都会引用具体的源文件和行号范围。
  • Domain Templates: 为研究和编辑工作流预构建的模板,定义特定实体类型和生命周期。
  • MCP Server: 允许 AI 代理直接摄取、编译、查询和管理维基。
  • Open Knowledge Format (OKF): 支持以可移植的 Markdown 包导入和导出知识。
  • Incremental Compilation: 仅处理已更改的来源,以节省时间和 API 成本。
  • Review Policy: 可根据置信度或来源规则,将生成的页面保留待人工批准。