tesseract-ocr/tesseract
Tesseract Open Source OCR Engine (main repository)
What it solves
它提供了一種將文字圖片轉換為機器可讀文字的方法,這個過程被稱為光學字元辨識 (OCR)。這讓使用者能夠從各種圖片格式中提取文字,並將其輸出為純文字、PDF 或 HTML 等格式。
How it works
Tesseract 使用兩種不同的 OCR 引擎:一種是基於長短期記憶 (LSTM) 的現代神經網路,專注於行辨識;另一種是辨識個別字元模式的傳統引擎。它會處理輸入的圖片(例如 PNG, JPEG, 和 TIFF),並使用經過訓練的數據文件來辨識超過 100 種不同語言的文字。
Who it's for
它同時設計給需要命令列工具進行文字提取的使用者,以及希望透過 libtesseract C/C++ API 將 OCR 功能整合到自己應用程式中的開發者。
Highlights
- 支持超過 100 種語言。
- 提供多種輸出格式,包括純文字、hOCR、PDF、TSV、ALTO, 和 PAGE。
- 支持 Unicode (UTF-8)。
- 可以透過訓練來辨識新語言。
相關
- 專案
- 專案
- 專案
- 專案
- 專案