icereed/paperless-gpt

Use LLMs and LLM Vision (OCR) to handle paperless-ngx - Document Digitalization powered by AI

解决的问题

paperless-gptpaperless-ngx 的 AI 驱动型辅助工具,旨在自动化繁琐的手动文档分类工作。它解决了在低质量扫描件或复杂布局文档中,传统 OCR 常常难以处理的手动命名、标签化和数据提取问题。

工作原理

该工具通过 API 与 paperless-ngx 集成,利用大语言模型(LLM)和专业 OCR 服务分析文档内容。可配置多种提供商,分别用于通用 LLM 任务(如命名)和特定 OCR 任务(如文本提取)。

  • OCR 提供商:支持基于 LLM 的 OCR(使用具备视觉能力的模型如 GPT-4o 或 MiniCPM-V)、Azure Document Intelligence、Google Document AI 以及自托管的 Docling 服务器。
  • 元数据生成:AI 分析提取的文本,自动为文档生成标题、标签、创建日期和对应人。
  • 自定义字段提取:支持三种写入模式(追加、更新、替换),可将特定数据提取到自定义字段中。
  • PDF 增强:使用 Google Document AI 时,可生成带有透明文本层的可搜索 PDF,覆盖在原始图像之上。

适用人群

希望自动化文档管理流程的 paperless-ngx 用户,特别是处理大量扫描文档或需要从杂乱扫描件中高精度提取文本的用户。

主要亮点

  • LLM 增强 OCR:使用视觉 LLM 将低质量扫描件转化为具有上下文感知能力的文本。
  • 自动整理:自动生成功能标题、标签、日期和对应人。
  • 可自定义提示:通过 Web UI 直接管理标题和标签的 AI 提示。
  • 灵活的 OCR 选项:支持多种企业级和本地提供商(OpenAI、Ollama、Azure、Google、Docling)。
  • 临时分析:允许用户对选定文档进行自定义分析或摘要。
  • 可搜索 PDF:通过 Google Document AI 生成可选中文本层的 PDF。
  • Docker 部署:可通过 Docker Compose 与 paperless-ngx 一起轻松部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目