axoviq-ai/synthadoc
Synthadoc: An open-source LLM knowledge compilation engine that turns raw documents into structured, local-first wikis. A transparent, human-readable alternative to traditional RAG, which can be self-managed and self-improved without the use of any tools.
解决的问题
Synthadoc 解决了传统检索增强生成(RAG)系统的局限性。传统 RAG 系统通常在查询时对文档片段进行摘要,而 Synthadoc 在数据摄入时就完成知识合成,将原始源文档转化为结构化、持久化的本地 Wiki。这种做法防止了矛盾被无声混合,确保每个主张都能追溯到具体来源,并创建一个独立于工具的永久性知识资产。
工作原理
Synthadoc 支持多种源格式(PDF、电子表格、PPT、网页、图像、视频、Word 文件、TXT、AI 会话转录等),利用 LLM 将其合成到本地 Markdown 基础的 Wiki 中。系统自动使用 [[wikilinks]] 构建交叉引用,并采用五状态生命周期机(draft → active → contradicted/stale → archived)管理页面状态。系统还包含一个对抗性第二 LLM 机制,用于标记夸大主张,以及一个 linting 流程,用于检测孤立页面和损坏的引用。
适用人群
- 个人研究者和独立开发者:需要使用免费或本地 LLM 模型构建个人研究 Wiki 的人。
- 小型团队:需要一个集中式内部知识库,能自动解决矛盾并随组织扩展而扩展的人。
- 企业:需要合规敏感、以本地优先的知识库,具备审计追踪和通过钩子实现 CI/CD 集成的人。
核心亮点
- 摄入时合成:在摄入时将源文档编译为 Wiki,而非在查询时重新摘要。
- 矛盾检测:将冲突主张标记为
status: contradicted,供人工审查或自动解决。 - 主张级溯源:提供内联引用
^[file:L-L],将每个主张链接回其原始来源行。 - 本地优先架构:以纯 Markdown 文件形式存储数据,避免厂商锁定,兼容 Obsidian 等工具。
- 知识图谱可视化:使用 Louvain 聚类生成加权知识图谱,可视化页面间关系。
- 对抗性审查:使用第二 LLM 通过对抗性流程,标记无依据的最高级表述和有争议的事实。
相关
- 项目
- 项目
- 项目
- 项目
- 项目