OCR4all/OCR4all
Provides OCR (Optical Character Recognition) services through web applications
解决的问题
OCR4all 提供了一个半自动工作流程,用于对历史印刷品执行光学字符识别 (OCR)。它旨在让没有技术背景的用户也能从早期印本中获得高质量的文字识别结果,这些印本通常是标准 OCR 工具难以处理的。
运作方式
该项目整合了多种用于文档分析和文字识别的专业工具,包括 OCRopus、Calamari 以及用于版面分析的 LAREX。它提供了一个主界面和服务器来管理工作流程,允许用户进行手动交互,以在自动化失败时优化结果并提高准确性。
目标用户
需要将历史文档和早期印本转录为数字文字的研究人员、历史学家以及没有技术背景的用户。
特色亮点
- 半自动工作流程,允许手动校正与交互。
- 专为历史印刷品和早期印本进行了优化。
- 整合了多种 OCR 引擎和文档分析程序。
- 提供预先配置的 Docker 镜像,便于安装。
相关
- 项目
- 项目
- 项目
- 项目