PaddleOCR 3.5 发布说明 / 新功能

PaddleOCR 3.5 引入了灵活的推理引擎接口,允许开发者通过 engine 参数选择后端。将 engine="transformers" 设置后,支持的模型即可使用 Transformers 库运行。

虽然 Transformers 后端现在成为一种选项,PaddleOCR 仍然负责这些任务背后的流水线,这意味着开发者无需手动调用内部组件。后端特定的选项——例如 dtype、设备放置和注意力实现——可以通过 engine_config 参数进行配置。

推理后端灵活性

PaddleOCR 3.5 引入了灵活的推理引擎接口,允许开发者通过 engine 参数选择后端。将 engine="transformers" 设置后,支持的模型即可使用 Transformers 库运行。

虽然 Transformers 后端现在成为一种选项,PaddleOCR 仍然负责这些任务背后的流水线,这意味着开发者无需手动调用内部组件。后端特定的选项——例如 dtype、设备放置和注意力实现——可以通过 engine_config 参数进行配置。

PaddleOCR 3.5 架构层次

描述 示例
应用层 利用 OCR 和文档解析输出的应用 RAG、agents、Document AI
模型层 OCR 和文档解析能力 PP-OCRv5、PaddleOCR-VL 1.5
推理后端层 用于运行支持模型的运行时 Paddle 静态图、Paddle 动态图、Transformers

关键能力与支持的模型

此版本侧重于推理后端层,而非全新模型架构。PaddleOCR 继续提供高性能的 OCR 与文档解析模型系列,包括:

  • PP-OCRv5:OCR 模型系列。
  • PaddleOCR-VL 1.5:文档解析模型系列。

这些模型现在可以使用 Transformers 后端运行,以更好地适配 PyTorch / Transformers 基础设施进行模型加载、实验和部署。

实现与快速入门

要使用 Transformers 后端,开发者需安装 paddleocr==3.5.0paddlex==3.5.2transformers>=5.4.0,以及兼容的 PyTorch 版本。

命令行界面 (CLI)

paddleocr ocr \
  -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
  --device gpu:0 \
  --engine transformers

Python API

from paddleocr import PaddleOCR

pipeline = PaddleOCR(
    device="gpu:0",
    engine="transformers",
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine_config={
        "dtype": "float32",
    },
)

results = pipeline.predict(
    "https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)

开发者可以通过 engine_config 使用诸如 dtype(例如 bfloat16)、device_typedevice_idattn_implementation(例如 sdpa)等参数进一步调优性能。

何时使用 Transformers 后端

对于已经依赖 PyTorch / Transformers 基础设施进行模型制品管理和部署的团队,推荐使用 Transformers 后端。它提供更熟悉的开发体验以及与 Hub 兼容的模型发现功能。

然而,对于优先追求最高 OCR 或文档解析吞吐量的用户,默认的 paddle_static 后端仍是推荐选择。本次发布提供了灵活性,而非取代现有后端。

资源

Sources