aiptimizer/TurboOCR
TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC
解決的問題
TurboOCR 是一個高效率的 GPU 加速文件解析器,專門用於將影像和 PDF 轉換為結構化的 Markdown。它解決了傳統 OCR 和 VLM(視覺語言模型)解析器的效能瓶頸,能在單一 GPU 上以每秒處理數百張影像的速度運作,同時保持對表單、收據和密集文件的高準確度。
工作原理
此專案使用 C++、CUDA 和 TensorRT 构建,實現了一個多串流引擎,運行一系列專用模型的處理流程,而非單一的巨無霸模型。它使用 PP-OCRv6 進行文字偵測與識別,PP-DocLayoutV3 進行版面分析,並搭配專用模型如 SLANet-Plus(將表格轉換為 HTML)和 PP-FormulaNet-S(將數學公式轉換為 LaTeX)。系統以伺服器形式部署,提供 HTTP 和 gRPC API,TensorRT 引擎會在首次啟動時自動建構,以針對特定 GPU 硬體最佳化效能。
適用對象
適用於需要工業級文件數位化的開發者與組織,特別是那些處理大量收據、表單或學術論文,且對低延遲與高吞吐量有嚴格要求的使用者。
主要特色
- 極高吞吐量:在 RTX 5090 上,每秒可處理最多 559 張收據影像。
- 結構化輸出:不僅提供簡單的文字提取,還支援版面分析、閱讀順序、HTML 表格與 LaTeX 公式。
- 彈性準確度層級:提供
tiny、small和medium三種模型層級,讓使用者可依需求在速度與準確度之間權衡。 - 原生 PDF 支援:可平行渲染與 OCR PDF 頁面,並支援可選的自動旋轉功能。
- 廣泛語言支援:預設支援拉丁文、中文與日文,並額外支援阿拉伯文、西里爾文、韓文、泰文與希臘文。
這是一個極快的 GPU 文件解析器,能將影像與 PDF 轉換為結構化 Markdown,包含表格與公式,使用 C++、CUDA 與 TensorRT。 — @handle
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案