PaddleOCR 3.5 版本說明 / 新功能

PaddleOCR 3.5 版本說明 / 新功能

PaddleOCR 3.5 使得支援的 OCR 與文件解析模型可以使用 Hugging Face Transformers 作為推論後端。此更新讓開發者能將 PaddleOCR 的功能整合到以 Hugging Face 為中心的環境中,降低整合摩擦,特別適用於 RAG 與 Document AI 應用。

推論後端彈性

PaddleOCR 3.5 引入彈性的推論引擎介面,讓開發者可以透過 engine 參數選擇後端。將 engine="transformers" 設定後,支援的模型即可使用 Transformers 函式庫執行。

雖然 Transformers 後端現在成為一個選項,PaddleOCR 仍會管理這些任務背後的管線,意味著開發者不需要手動呼叫內部元件。特定後端的選項——例如 dtype、設備配置與注意力實作——可透過 engine_config 參數進行設定。

PaddleOCR 3.5 架構層級

層級 說明 範例
應用層 使用 OCR 與文件解析輸出的應用程式 RAG、agents、Document AI
模型層 OCR 與文件解析功能 PP-OCRv5、PaddleOCR-VL 1.5
推論後端層 用於執行支援模型的執行環境 Paddle 靜態圖、Paddle 動態圖、Transformers

主要功能與支援模型

此版本著重於推論後端層,而非全新模型架構。PaddleOCR 繼續提供高效能的 OCR 與文件解析模型系列,包括:

  • PP-OCRv5:OCR 模型系列。
  • PaddleOCR-VL 1.5:文件解析模型系列。

這些模型現在可以使用 Transformers 後端執行,以更好地融入 PyTorch / Transformers 基礎設施,進行模型載入、實驗與部署。

實作與快速上手

若要使用 Transformers 後端,開發者必須安裝 paddleocr==3.5.0paddlex==3.5.2transformers>=5.4.0,以及相容的 PyTorch 版本。

命令列介面 (CLI)

paddleocr ocr \
  -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
  --device gpu:0 \
  --engine transformers

Python API

from paddleocr import PaddleOCR

pipeline = PaddleOCR(
    device="gpu:0",
    engine="transformers",
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine_config={
        "dtype": "float32",
    },
)

results = pipeline.predict(
    "https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)

開發者可透過 engine_config 進一步調校效能,使用的參數包括 dtype(例如 bfloat16)、device_typedevice_idattn_implementation(例如 sdpa)。

何時使用 Transformers 後端

若團隊已經依賴 PyTorch / Transformers 基礎設施進行模型資產管理與部署,建議使用 Transformers 後端。它提供更熟悉的開發體驗,且支援 Hub 相容的模型搜尋。

然而,對於優先考慮最高 OCR 或文件解析吞吐量的使用者,預設的 paddle_static 後端仍是建議的選擇。本次發布提供彈性,而非取代既有後端。

資源

Sources