clusterzx/paperless-ai

An automated document analyzer for Paperless-ngx using OpenAI API, Ollama, Deepseek-r1, Azure and all OpenAI API compatible Services to automatically analyze and tag your documents.

📄 Paperless‑AI – Paperless‑ngx 的 AI 增强文档管理

是什么 – 一个开源插件,可接入自托管文档归档系统 Paperless‑ngx。它会监控新上传的文件,将文本发送至 LLM(OpenAI 兼容服务、Ollama、Gemini 等),并自动执行:

  • 生成标题并选择标签 / 文档类型
  • 将 LLM 生成的元数据存回 Paperless‑ngx
  • 构建向量索引,使您能对整个档案库提出自然语言问题(RAG 聊天)

为何重要 – 无需手动标注,即可将静态 PDF 库转变为可搜索的知识库。所有繁重任务(嵌入、分类、聊天)均由您指定的兼容 LLM 完成,因此您可将数据保留在本地(如 Ollama)或使用云 API。


核心功能

功能 你能获得
自动处理 检测新文档,提取文本,调用选定的 LLM,写回标题、标签、联系人等信息
多模型支持 支持 Ollama(Mistral、Llama、Phi‑3、Gemma‑2 …)、OpenAI、DeepSeek、OpenRouter、Perplexity、Together、LiteLLM、VLLM、FastChat、Gemini 及任何 OpenAI 兼容端点
基于 RAG 的聊天 从您的文档构建语义向量存储;可提问如 “我什么时候签了租房合同?” 并获得带来源引用的自然语言回答
手动 UI /manual 页面可对单个文档运行 AI,适用于您希望在保存元数据前审查的敏感文件
智能标签与规则 可定义过滤器限制处理文档范围,开启/关闭提示,将 LLM 输出映射为自定义标签
Docker 就绪 官方镜像包含健康检查、持久化卷和自动重启;支持一键部署
Web 界面 与 Paperless‑ngx 集成的响应式 UI,用于配置模型、API 密钥和查看 RAG 聊天

快速开始(Docker)

  1. 创建容器 – 拉取 clusterzx/paperless-ai 并挂载与 Paperless‑ngx 相同的卷,以便插件读取 PDF 文件。
  2. 配置 – 打开 UI,添加您的 LLM API 密钥(OpenAI、Ollama 端点等)并设置所需的标签规则。
  3. 首次运行 – 保存设置后重启容器;它将扫描现有文档,生成嵌入向量并构建 RAG 索引。
  4. 使用 – 新文件将自动处理。访问聊天页面,对整个档案库提出自然语言查询。

详细步骤请参阅 安装 Wiki


开发与贡献

  • 克隆仓库,运行 npm install 然后 npm run test 启动本地开发服务器。
  • 欢迎提交 PR;README 中列出了常见的 fork-branch-PR 工作流。
  • 社区支持位于 GitHub Issues 和 Discord 服务器中。

许可与支持

  • MIT 许可证 – 可自由使用、修改和分发。
  • 作者正在寻找贡献者;可通过 Patreon/PayPal/Ko‑fi 页面进行可选捐赠。

总结 – Paperless‑AI 为自托管文档档案库添加了 LLM 驱动的分类、标签和语义搜索功能,让您仅用自然语言提问即可从 PDF 中检索信息,同时确保数据完全由您掌控。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目