UB-Mannheim/zotero-ocr
Zotero Plugin for OCR
解決的問題
讓使用者能在 Zotero 內直接對 PDF 檔案執行光學字元辨識(OCR),將無法搜尋的 PDF 變成可搜尋的,並從文件影像中提取文字。
作法說明
此外掛整合了 Tesseract OCR 與 pdftoppm(來自 Poppler 工具)。當使用者選取 PDF 並透過右鍵功能表觸發 OCR 過程時,工具會處理文件,並可產生帶有文字層的新 PDF、包含辨識文字的筆記,或 HTML(hOCR)檔案。
適用對象
使用 Zotero 管理文獻庫,並需要將掃描檔或影像型 PDF 變成可搜尋與可存取的研究人員、學生與學者。
主要特色
- Tesseract 整合:使用業界標準的 Tesseract OCR 引擎進行文字辨識。
- 彈性輸出:可產生包含辨識文字的新 PDF、僅文字的筆記,或 hOCR 檔案。
- 可自訂設定:允許使用者調整輸出 DPI、Tesseract 頁面分割模式(PSM)與語言/文字模型。
- 附件管理:支援將處理後的 PDF 作為一般附件或連結檔案新增。
相關
- 專案
- 專案
- 專案
- 專案
- 專案