ocrmypdf/OCRmyPDF
OCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched
解决的问题
OCRmyPDF 将本质上只是文字图像的扫描 PDF 文件,通过添加隐藏的 OCR 文本层,转换为可搜索和可复制粘贴的文档。它解决了其他 OCR 工具常见的问题,例如文本错位、多语言支持差、图像分辨率丢失,以及生成过大或无效的 PDF 文件。
工作原理
这是一个用 Python 编写的可脚本化的命令行工具,集成了 Tesseract OCR 引擎,可识别超过 100 种语言的文本。该工具处理 PDF,可选地清理图像(校正页面倾斜或旋转),并将识别出的文本准确地置于原始图像下方。它可以生成 PDF/A 文件(专为长期归档设计),并利用多个 CPU 核心分摊工作负载,提高效率。
适用人群
适用于需要数字化大量扫描文档的用户、希望通过命令行自动化 PDF 处理的开发者,以及需要符合规范的 PDF/A 文件用于归档的组织。
主要亮点
- 高保真度:保持原始图像分辨率,并在可能的情况下执行无损操作。
- 优化:通常比输入文件更小的最终文件大小。
- 图像校正:内置功能可校正倾斜的页面和纠正错误旋转的页面。
- 可扩展性:提供插件接口,可将 Tesseract 替换为 EasyOCR 或 PaddleOCR 等其他引擎。
相关
- 项目
- 项目
- 项目
- 项目
- 项目