PaddleOCR 3.5 版本說明 / 新功能
PaddleOCR 3.5 版本說明 / 新功能
PaddleOCR 3.5 使得支援的 OCR 與文件解析模型可以使用 Hugging Face Transformers 作為推論後端。此更新讓開發者能將 PaddleOCR 的功能整合到以 Hugging Face 為中心的環境中,降低整合摩擦,特別適用於 RAG 與 Document AI 應用。
推論後端彈性
PaddleOCR 3.5 引入彈性的推論引擎介面,讓開發者可以透過 engine 參數選擇後端。將 engine="transformers" 設定後,支援的模型即可使用 Transformers 函式庫執行。
雖然 Transformers 後端現在成為一個選項,PaddleOCR 仍會管理這些任務背後的管線,意味著開發者不需要手動呼叫內部元件。特定後端的選項——例如 dtype、設備配置與注意力實作——可透過 engine_config 參數進行設定。
PaddleOCR 3.5 架構層級
| 層級 | 說明 | 範例 |
|---|---|---|
| 應用層 | 使用 OCR 與文件解析輸出的應用程式 | RAG、agents、Document AI |
| 模型層 | OCR 與文件解析功能 | PP-OCRv5、PaddleOCR-VL 1.5 |
| 推論後端層 | 用於執行支援模型的執行環境 | Paddle 靜態圖、Paddle 動態圖、Transformers |
主要功能與支援模型
此版本著重於推論後端層,而非全新模型架構。PaddleOCR 繼續提供高效能的 OCR 與文件解析模型系列,包括:
- PP-OCRv5:OCR 模型系列。
- PaddleOCR-VL 1.5:文件解析模型系列。
這些模型現在可以使用 Transformers 後端執行,以更好地融入 PyTorch / Transformers 基礎設施,進行模型載入、實驗與部署。
實作與快速上手
若要使用 Transformers 後端,開發者必須安裝 paddleocr==3.5.0、paddlex==3.5.2 與 transformers>=5.4.0,以及相容的 PyTorch 版本。
命令列介面 (CLI)
paddleocr ocr \
-i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
--device gpu:0 \
--engine transformers
Python API
from paddleocr import PaddleOCR
pipeline = PaddleOCR(
device="gpu:0",
engine="transformers",
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
engine_config={
"dtype": "float32",
},
)
results = pipeline.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)
開發者可透過 engine_config 進一步調校效能,使用的參數包括 dtype(例如 bfloat16)、device_type、device_id 與 attn_implementation(例如 sdpa)。
何時使用 Transformers 後端
若團隊已經依賴 PyTorch / Transformers 基礎設施進行模型資產管理與部署,建議使用 Transformers 後端。它提供更熟悉的開發體驗,且支援 Hub 相容的模型搜尋。
然而,對於優先考慮最高 OCR 或文件解析吞吐量的使用者,預設的 paddle_static 後端仍是建議的選擇。本次發布提供彈性,而非取代既有後端。
資源
- 線上示範: Hugging Face Spaces
- 模型中心: PaddlePaddle on Hugging Face
- 文件說明: PaddleOCR Official Site