PP-OCRv6 发布:支持 50 种语言的 OCR,参数量从 1.5M 到 34.5M

PP-OCRv6 发布:支持 50 种语言的 OCR,参数量从 1.5M 到 34.5M

PaddlePaddle 发布了 PP-OCRv6,这是 PaddleOCR 通用模型系列的最新一代,旨在在各种真实场景中实现高精度的文本检测和识别。此发布为文档、截图、多语言图像和工业标签提供了可扩展的解决方案,并提供了三种不同的模型层级,以在准确性和计算效率之间取得平衡。

可扩展的模型层级与性能

PP-OCRv6 分为三层,以适应不同的部署约束,覆盖从边缘设备到高性能服务器的场景。中等层级实现了 86.2% 的检测 Hmean 和 83.2% 的识别准确率,相较于之前的 PP-OCRv5_server 模型有显著提升(检测提升 4.6 个百分点,识别提升 5.1 个百分点)。

模型 模型大小 检测 Hmean 识别准确率 典型应用场景
PP-OCRv6_tiny 1.5M params 80.6% 73.5% 边缘设备、轻量本地 OCR、对延迟敏感的演示、受限环境
PP-OCRv6_small 7.7M params 84.1% 81.3% 移动端、桌面端、均衡的 OCR 服务、计算成本更低的多语言 OCR
PP-OCRv6_medium 34.5M params 86.2% 83.2% 以准确性为导向的 OCR、服务器端流水线、工业 OCR、文档摄取、多语言 OCR

架构改进

PP-OCRv6 为 OCR 流程的检测和识别阶段引入了特定的架构更新,以提升在复杂真实输入上的性能。

统一骨干网络

该模型系列使用 PPLCNetV4 作为文本检测和文本识别的统一骨干网络。这在 tiny、small、medium 三个层级之间提供了架构一致性。

使用 RepLKFPN 加强文本检测

为了解决小尺寸、密集或旋转文本等挑战,检测模块已升级为 RepLKFPN。这是一种轻量级的大核特征金字塔网络,旨在提升多尺度文本检测能力,同时保持推理效率。

使用 EncoderWithLightSVTR 改进识别

在识别阶段,PP-OCRv6 使用 EncoderWithLightSVTR。该架构将局部上下文建模与全局注意力相结合,提升了对多语言文本、屏幕文本以及噪声图像区域等挑战性文本裁剪的识别质量。

多语言支持与部署

PP-OCRv6 在 small 和 medium 两个层级中提供统一的多语言支持。这些模型支持 50 种语言,包括简体中文、繁体中文、英文、日文以及 46 种拉丁字母语言,从而降低了对多个专用模型的需求。

推理后端

开发者可以通过 PaddleOCR 库使用多种推理后端来集成 PP-OCRv6:

  • Transformers:面向 Hugging Face / PyTorch 的推理路径。
  • ONNX Runtime:适用于基于 ONNX 的部署环境的便携路径。
  • Paddle Inference:原生的 Paddle 推理格式。

模型资产在 Hugging Face Hub 上提供多种格式,包括 safetensorsPaddle inference modelsONNX models

Sources