scribeocr/scribeocr
Web interface for recognizing text, proofreading OCR, and creating fully-digitized documents.
解决的问题
Scribe OCR 旨在解决 OCR(光学字符识别)数据不准确或对齐不佳的问题。传统 OCR 工具通常生成的是大致位于图像上方的“不可见文本”层,而 Scribe OCR 专注于高精度对齐和高效校对,将 OCR 准确率从 98% 提升至 100%。
如何工作
该应用完全在浏览器中运行,确保数据不会发送到远程服务器。它使用 Scribe.js 库进行文本识别。为了更易于发现错误,该工具为每个文档生成自定义字体,优化原始扫描图像与叠加文本之间的对齐。它提供专门的校对模式,可将可编辑文本精确叠加在源图像上,并以红色突出显示低置信度字符,以引导用户。
适用人群
适用于需要创建完全数字化、复现原始文档布局的 ebook 风格 PDF(无图像背景)的用户,也适用于需要创建准确可搜索 PDF 或校对现有 OCR 数据(包括 Tesseract HOCR 文件)的用户。
主要亮点
- 浏览器内处理:所有识别和处理均在浏览器本地完成。
- 字体优化:为每个文档生成自定义字体,以提升文本对齐精度和错误检测能力。
- ebook 模式:生成小文件体积的文本原生 PDF,忠实还原原始布局。
- 灵活导出:支持 ebook 风格 PDF 和传统图像上叠加不可见文本的 PDF。
- HOCR 支持:可编辑和修正其他应用程序生成的 OCR 数据。
相关
- 项目
- 项目
- 项目
- 项目
- 项目