atomicstrata/llm-wiki-compiler
The knowledge compiler. Raw sources in, interlinked wiki out. Inspired by Karpathy's LLM Wiki pattern.
解决的问题
llmwiki 将原始的非结构化数据(PDF、笔记、网页、转录文本)转换为结构化、相互链接的 Markdown 知识库。与传统的 RAG(检索增强生成)不同,后者在查询时检索原始片段,llmwiki 一次性将知识编译为持久、可追溯引用的页面,供 AI 代理和人类浏览与查询。这避免了每次提问时都需要重新发现文档之间的关系。
工作原理
该系统采用两阶段 LLM 流水线,提取概念并生成类型化页面(如概念、实体、比较等)。它实现了知识管理的「编译时」方法:
- 摄入:原始源文件被收集到
sources/目录中。 - 编译:LLM 将这些源文件处理为带有 YAML 前置元数据的相互链接的 Markdown 文件,并存储在
wiki/目录中。 - 生命周期配置文件:用户可定义
.llmwiki/profile.json来声明类型化实体、关系和工作流,确保生成的知识遵循特定领域模式(例如研究或编辑)。 - 检索:采用混合方法,结合语义分块搜索、BM25 重排序和维基链接图扩展,为查询提供上下文。
适用人群
- AI 代理开发者:需要稳定、具备引用意识的上下文包,而非一堆松散文件的代理构建者。
- 研究人员和编辑:管理大量领域特定材料,需要可审计、结构化知识库的人。
- 知识工程师:希望实现「LLM 知识库」模式,构建持久、可累积知识的人。
核心亮点
- 引用可追溯性:每个主张和段落都引用特定源文件和行范围,由内置的 linter 进行验证。
- 可配置生命周期配置文件(CLP):支持创建具有强制实体模式和信任门控的领域特定知识基底。
- MCP 服务器:向 MCP 兼容代理暴露 wiki 的功能(摄入、编译、查询、评估)。
- 开放知识格式(OKF):支持以可移植的 Markdown 套件形式导入和导出知识。
- 质量门控:包含评估工具(
llmwiki eval)和审查策略,可将生成的页面暂存以待人工审批。
相关
- 项目
- 项目
- 项目
- 项目
- 项目