atomicstrata/llm-wiki-compiler
The knowledge compiler. Raw sources in, interlinked wiki out. Inspired by Karpathy's LLM Wiki pattern.
What it solves
llmwiki 将原始、未结构化的数据(PDF、网页、笔记、转录稿)转化为结构化、相互链接的 Markdown 维基。不同于传统的 RAG(检索增强生成),后者在查询时检索原始片段,llmwiki 在编译时一次性将知识编译成持久、类型化的页面并附带引用。这避免了代理和人类在原始文件中反复重新发现关系,创建一个随时间累积、可审计的稳定知识库。
How it works
系统使用两阶段 LLM 流水线来抽取概念并生成类型化页面(如概念、实体、比较)。它实现了“编译时”知识的理念:将来源摄入并处理成以 YAML front‑matter 存储的 Markdown 文件的维基结构。
关键架构组件包括:
- Configurable Lifecycle Profiles (CLP): 基于 JSON 的合约,定义实体 schema、关系和信任门槛,确保运行时执行领域特定规则,而不是依赖提示约定。
- Hybrid Retrieval: 结合语义块搜索、BM25 重排序和 wikilink 图扩展,为查询构建上下文包。
- Quality Gates: 包含用于校验引用和链接的 lint 系统,以及用于衡量健康分数和引用精度的评估框架。
- Integration Layers: 提供 CLI、TypeScript SDK 和 MCP(Model Context Protocol)服务器,允许代理与维基交互。
Who it’s for
它面向需要从原始材料构建持久、可审计知识库的用户,例如使用 autosci 模板的研究人员或使用 newsroom 模板的编辑团队,以及构建需要稳定、带引用上下文的 AI 代理的开发者。
Highlights
- Citation-Traceable Output: 每个声明和段落都会引用具体的源文件和行号范围。
- Domain Templates: 为研究和编辑工作流预构建的模板,定义特定实体类型和生命周期。
- MCP Server: 允许 AI 代理直接摄取、编译、查询和管理维基。
- Open Knowledge Format (OKF): 支持以可移植的 Markdown 包导入和导出知识。
- Incremental Compilation: 仅处理已更改的来源,以节省时间和 API 成本。
- Review Policy: 可根据置信度或来源规则,将生成的页面保留待人工批准。