scribeocr/scribeocr
Web interface for recognizing text, proofreading OCR, and creating fully-digitized documents.
解決的問題
Scribe OCR 是為了解決 OCR(光學字元辨識)資料不準確或對齊不良的問題而設計。傳統 OCR 工具通常產生大致置於影像上方的「不可見文字」層,而 Scribe OCR 則專注於高精度對齊與高效校對,將 OCR 準確率從 98% 提升至 100%。
如何運作
此應用完全在瀏覽器中執行,確保資料不會傳送至遠端伺服器。它使用 Scribe.js 庫進行文字辨識。為了讓錯誤更容易被發現,該工具會為每個文件生成自訂字型,優化原始掃描與疊加文字之間的對齊。它提供專用的校對模式,可將可編輯文字精確疊加在原始影像上,並以紅色標示低置信度字元,引導使用者。
適用對象
適合需要創建完全數位化、忠實重現原始文件版面的 ebook 風格 PDF(無影像背景)的使用者,也適合需要創建精確可搜尋 PDF 或校對既有 OCR 資料(包括 Tesseract HOCR 檔案)的使用者。
主要特色
- 瀏覽器內處理:所有辨識與處理皆在瀏覽器本地完成。
- 字型優化:為每個文件生成自訂字型,以提升文字對齊精度與錯誤偵測能力。
- ebook 模式:產生小檔案體積的純文字 PDF,忠實還原原始版面。
- 彈性匯出:支援 ebook 風格 PDF 與傳統影像上疊加不可見文字的 PDF。
- HOCR 支援:可編輯與修正其他應用程式產生的 OCR 資料。
相關
- 專案
- 專案
- 專案
- 專案
- 專案