tesseract-ocr/tesseract
Tesseract Open Source OCR Engine (main repository)
What it solves
它提供了一种将图像中的文字转换为机器可读文本的方法,这一过程被称为光学字符识别 (OCR)。这使得用户可以从各种图像格式中提取文本,并将其输出为纯文本、PDF 或 HTML 等格式。
How it works
Tesseract 使用两种不同的 OCR 引擎:一种是基于长短期记忆 (LSTM) 的现代神经网络,专注于行识别,另一种是识别单个字符模式的传统引擎。它处理输入图像(如 PNG, JPEG, 和 TIFF),并使用训练好的数据文件来识别超过 100 种不同语言的文本。
Who it's for
它既适用于需要命令行工具进行文本提取的终端用户,也适用于希望通过 libtesseract C/C++ API 将 OCR 能力集成到自己的应用程序中的开发人员。
Highlights
- 开箱即用支持超过 100 种语言。
- 提供多种输出格式,包括纯文本、hOCR、PDF、TSV、ALTO, 和 PAGE。
- 支持 Unicode (UTF-8)。
- 可以通过训练来识别新语言。
相关
- 项目
- 项目
- 项目
- 项目
- 项目