PP-OCRv6 發布:支援 50 種語言的 OCR,參數量從 1.5M 到 34.5M

PP-OCRv6 發布:支援 50 種語言的 OCR,參數量從 1.5M 到 34.5M

PaddlePaddle 已發布 PP-OCRv6,這是 PaddleOCR 通用模型家族的最新一代,旨在於多樣的真實場景中提供高精度的文字檢測與識別。此版本提供針對文件、螢幕截圖、多語言圖像與工業標籤的可擴展解決方案,並提供三種不同的模型層級,以在精度與計算效能之間取得平衡。

可擴展模型層級與效能

PP-OCRv6 被劃分為三個層級,以因應從邊緣設備到高效能伺服器的不同部署限制。中等層級達到 86.2% 的檢測 Hmean 與 83.2% 的識別準確率,較前一代 PP-OCRv5_server 模型分別提升了 4.6 個百分點(檢測)與 5.1 個百分點(識別)。

模型 模型大小 檢測 Hmean 識別準確率 典型應用場景
PP-OCRv6_tiny 1.5M params 80.6% 73.5% 邊緣設備、輕量本地 OCR、對延遲敏感的演示、受限環境
PP-OCRv6_small 7.7M params 84.1% 81.3% 行動裝置、桌面、平衡的 OCR 服務、計算成本較低的多語言 OCR
PP-OCRv6_medium 34.5M params 86.2% 83.2% 以準確度為導向的 OCR、伺服器端流水線、工業 OCR、文件匯入、多語言 OCR

架構改進

PP-OCRv6 為 OCR 流程的檢測與識別階段引入了特定的架構更新,以提升在複雜真實輸入上的效能。

統一骨幹網路

模型家族使用 PPLCNetV4 作為文字檢測與文字識別的統一骨幹網路,確保 tiny、small、medium 三個層級在架構上的一致性。

使用 RepLKFPN 加強文字檢測

為了解決小字、密集或旋轉文字等挑戰,檢測模組升級為 RepLKFPN。這是一種輕量的大核特徵金字塔網路,旨在提升多尺度文字檢測,同時保持推理效率。

使用 EncoderWithLightSVTR 改善文字識別

在識別階段,PP-OCRv6 採用 EncoderWithLightSVTR。此架構結合局部上下文建模與全局注意力,提升對多語言文字、螢幕文字與噪聲影像區域等挑戰性文字裁剪的識別品質。

多語言支援與部署

PP-OCRv6 在 small 與 medium 層級提供統一的多語言支援。這些模型支援 50 languages,包括簡體中文、繁體中文、英文、日文以及 46 種拉丁文字系語言,減少了對多個專門模型的需求。

推理後端

開發者可透過 PaddleOCR 套件整合 PP-OCRv6,使用以下多種推理後端:

  • Transformers:面向 Hugging Face / PyTorch 的推理路徑。
  • ONNX Runtime:適用於基於 ONNX 的部署環境的可移植路徑。
  • Paddle Inference:原生 Paddle 推理格式。

模型資產可於 Hugging Face Hub 取得,提供多種格式,包括 safetensorsPaddle inference modelsONNX models

Sources