PaddleOCR 3.5 发布说明 / 新功能
PaddleOCR 3.5 引入了灵活的推理引擎接口,允许开发者通过 engine 参数选择后端。将 engine="transformers" 设置后,支持的模型即可使用 Transformers 库运行。
虽然 Transformers 后端现在成为一种选项,PaddleOCR 仍然负责这些任务背后的流水线,这意味着开发者无需手动调用内部组件。后端特定的选项——例如 dtype、设备放置和注意力实现——可以通过 engine_config 参数进行配置。
推理后端灵活性
PaddleOCR 3.5 引入了灵活的推理引擎接口,允许开发者通过 engine 参数选择后端。将 engine="transformers" 设置后,支持的模型即可使用 Transformers 库运行。
虽然 Transformers 后端现在成为一种选项,PaddleOCR 仍然负责这些任务背后的流水线,这意味着开发者无需手动调用内部组件。后端特定的选项——例如 dtype、设备放置和注意力实现——可以通过 engine_config 参数进行配置。
PaddleOCR 3.5 架构层次
| 层 | 描述 | 示例 |
|---|---|---|
| 应用层 | 利用 OCR 和文档解析输出的应用 | RAG、agents、Document AI |
| 模型层 | OCR 和文档解析能力 | PP-OCRv5、PaddleOCR-VL 1.5 |
| 推理后端层 | 用于运行支持模型的运行时 | Paddle 静态图、Paddle 动态图、Transformers |
关键能力与支持的模型
此版本侧重于推理后端层,而非全新模型架构。PaddleOCR 继续提供高性能的 OCR 与文档解析模型系列,包括:
- PP-OCRv5:OCR 模型系列。
- PaddleOCR-VL 1.5:文档解析模型系列。
这些模型现在可以使用 Transformers 后端运行,以更好地适配 PyTorch / Transformers 基础设施进行模型加载、实验和部署。
实现与快速入门
要使用 Transformers 后端,开发者需安装 paddleocr==3.5.0、paddlex==3.5.2 和 transformers>=5.4.0,以及兼容的 PyTorch 版本。
命令行界面 (CLI)
paddleocr ocr \
-i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
--device gpu:0 \
--engine transformers
Python API
from paddleocr import PaddleOCR
pipeline = PaddleOCR(
device="gpu:0",
engine="transformers",
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
engine_config={
"dtype": "float32",
},
)
results = pipeline.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)
开发者可以通过 engine_config 使用诸如 dtype(例如 bfloat16)、device_type、device_id 和 attn_implementation(例如 sdpa)等参数进一步调优性能。
何时使用 Transformers 后端
对于已经依赖 PyTorch / Transformers 基础设施进行模型制品管理和部署的团队,推荐使用 Transformers 后端。它提供更熟悉的开发体验以及与 Hub 兼容的模型发现功能。
然而,对于优先追求最高 OCR 或文档解析吞吐量的用户,默认的 paddle_static 后端仍是推荐选择。本次发布提供了灵活性,而非取代现有后端。
资源
- 实时演示: Hugging Face Spaces
- 模型中心: PaddlePaddle on Hugging Face
- 文档: PaddleOCR Official Site