axoviq-ai/synthadoc

Synthadoc: An open-source LLM knowledge compilation engine that turns raw documents into structured, local-first wikis. A transparent, human-readable alternative to traditional RAG, which can be self-managed and self-improved without the use of any tools.

解决的问题

Synthadoc 解决了传统检索增强生成(RAG)系统的局限性。传统 RAG 系统通常在查询时对文档片段进行摘要,而 Synthadoc 在数据摄入时就完成知识合成,将原始源文档转化为结构化、持久化的本地 Wiki。这种做法防止了矛盾被无声混合,确保每个主张都能追溯到具体来源,并创建一个独立于工具的永久性知识资产。

工作原理

Synthadoc 支持多种源格式(PDF、电子表格、PPT、网页、图像、视频、Word 文件、TXT、AI 会话转录等),利用 LLM 将其合成到本地 Markdown 基础的 Wiki 中。系统自动使用 [[wikilinks]] 构建交叉引用,并采用五状态生命周期机(draftactivecontradicted/stalearchived)管理页面状态。系统还包含一个对抗性第二 LLM 机制,用于标记夸大主张,以及一个 linting 流程,用于检测孤立页面和损坏的引用。

适用人群

  • 个人研究者和独立开发者:需要使用免费或本地 LLM 模型构建个人研究 Wiki 的人。
  • 小型团队:需要一个集中式内部知识库,能自动解决矛盾并随组织扩展而扩展的人。
  • 企业:需要合规敏感、以本地优先的知识库,具备审计追踪和通过钩子实现 CI/CD 集成的人。

核心亮点

  • 摄入时合成:在摄入时将源文档编译为 Wiki,而非在查询时重新摘要。
  • 矛盾检测:将冲突主张标记为 status: contradicted,供人工审查或自动解决。
  • 主张级溯源:提供内联引用 ^[file:L-L],将每个主张链接回其原始来源行。
  • 本地优先架构:以纯 Markdown 文件形式存储数据,避免厂商锁定,兼容 Obsidian 等工具。
  • 知识图谱可视化:使用 Louvain 聚类生成加权知识图谱,可视化页面间关系。
  • 对抗性审查:使用第二 LLM 通过对抗性流程,标记无依据的最高级表述和有争议的事实。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目