UB-Mannheim/zotero-ocr

Zotero Plugin for OCR

解决的问题

使用户能够在 Zotero 内直接对 PDF 文件执行光学字符识别(OCR),将不可搜索的 PDF 变为可搜索的,并从文档图像中提取文本。

工作原理

该插件将 Tesseract OCR 和 pdftoppm(来自 Poppler 工具)集成到 Zotero 中。当用户选择一个 PDF 并通过右键菜单触发 OCR 过程时,该工具会处理文档,并可生成带有文本层的新 PDF、包含识别文本的笔记,或 HTML(hOCR)文件。

适用人群

使用 Zotero 管理文献库,并需要将扫描件或图像型 PDF 变为可搜索和可访问的科研人员、学生和学者。

主要亮点

  • Tesseract 集成:使用行业标准的 Tesseract OCR 引擎进行文本识别。
  • 灵活输出:可生成包含识别文本的新 PDF、仅文本的笔记,或 hOCR 文件。
  • 可自定义设置:允许用户调整输出 DPI、Tesseract 页面分割模式(PSM)和语言/脚本模型。
  • 附件管理:支持将处理后的 PDF 作为普通附件或链接文件添加。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目