aiptimizer/TurboOCR
TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC
它解决了什么问题
TurboOCR 是一款高性能、GPU 加速的文档解析器,旨在将图像和 PDF 转换为结构化的 Markdown。它解决了传统 OCR 和 VLM (Vision Language Model) 解析器的速度瓶颈,能够在单个 GPU 上每秒处理数百张图像,同时保持对表单、收据和密集文档的高准确度。
工作原理
该项目使用 C++、CUDA 和 TensorRT 构建,实现了一个多流引擎,运行一系列专门的模型流水线,而不是单一的庞大模型。它利用 PP-OCRv6 进行文本检测和识别,利用 PP-DocLayoutV3 进行布局分析,并使用专门的模型(如用于表格的 SLANet-Plus(将其转换为 HTML)和用于数学公式的 PP-FormulaNet-S(将其转换为 LaTeX))来处理表格和公式。 系统作为服务器部署,提供 HTTP 和 gRPC API,并在首次启动时自动构建 TensorRT 引擎,以针对特定的 GPU 硬件优化性能。
适用对象
它适用于需要工业级文档数字化的开发者和组织,特别是那些需要处理大量收据、表单或学术论文,且对低延迟和高吞吐量有严格要求的场景。
亮点
- 极高吞吐量:在 RTX 5090 上处理收据的速度最高可达每秒 559 张图像。
- 结构化输出:超越了简单的文本提取,提供布局分析、阅读顺序、HTML 表格和 LaTeX 公式。
- 灵活的准确度分级:提供
tiny、small和medium模型分级,允许用户在速度和更高的准确度之间进行权衡。 - 原生 PDF 支持:并行渲染并对 PDF 页面进行 OCR,并提供可选的自动旋转功能。
- 广泛的语言支持:默认覆盖拉丁语、中文和日语,并额外支持阿拉伯语、西里尔字母、韩语、泰语和希腊语。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目