tesseract-ocr/tesseract

Tesseract Open Source OCR Engine (main repository)

What it solves

它提供了一种将图像中的文字转换为机器可读文本的方法,这一过程被称为光学字符识别 (OCR)。这使得用户可以从各种图像格式中提取文本,并将其输出为纯文本、PDF 或 HTML 等格式。

How it works

Tesseract 使用两种不同的 OCR 引擎:一种是基于长短期记忆 (LSTM) 的现代神经网络,专注于行识别,另一种是识别单个字符模式的传统引擎。它处理输入图像(如 PNG, JPEG, 和 TIFF),并使用训练好的数据文件来识别超过 100 种不同语言的文本。

Who it's for

它既适用于需要命令行工具进行文本提取的终端用户,也适用于希望通过 libtesseract C/C++ API 将 OCR 能力集成到自己的应用程序中的开发人员。

Highlights

  • 开箱即用支持超过 100 种语言。
  • 提供多种输出格式,包括纯文本、hOCR、PDF、TSV、ALTO, 和 PAGE。
  • 支持 Unicode (UTF-8)。
  • 可以通过训练来识别新语言。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目