ocrmypdf/OCRmyPDF

OCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched

解決的問題

OCRmyPDF 將本質上只是文字影像的掃描 PDF 檔案,透過新增隱藏的 OCR 文字層,轉換為可搜尋且可複製貼上的文件。它解決了其他 OCR 工具常見的問題,例如文字錯位、多語系支援不佳、影像解析度損失,以及產生過大或無效的 PDF 檔案。

工作原理

這是一個以 Python 編寫的可腳本化命令列工具,整合了 Tesseract OCR 引擎,可識別超過 100 種語言的文本。該工具處理 PDF,可選擇性地清理影像(校正頁面傾斜或旋轉),並將識別出的文字準確地置於原始影像下方。它可產生 PDF/A 檔案(專為長期存檔設計),並利用多個 CPU 核心分散工作負載,提升效率。

適用對象

適用於需要數位化大量掃描文件的使用者、希望透過命令列自動化 PDF 處理的開發者,以及需要符合規範的 PDF/A 檔案用於存檔的組織。

主要特色

  • 高保真度:保持原始影像解析度,並在可能的情況下執行無損操作。
  • 優化:通常比輸入檔案更小的最終檔案大小。
  • 影像校正:內建功能可校正傾斜的頁面和修正錯誤旋轉的頁面。
  • 可擴展性:提供外掛介面,可將 Tesseract 替換為 EasyOCR 或 PaddleOCR 等其他引擎。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案