huridocs/pdf-document-layout-analysis

A Docker-powered service for PDF document layout analysis. This service provides a powerful and flexible PDF analysis service. The service allows for the segmentation and classification of different parts of PDF pages, identifying the elements such as texts, titles, pictures, tables and so on.

解決的問題

此專案提供了一個用於智慧 PDF 版面分析的微服務,讓使用者能將複雜的 PDF 文件轉換為 Markdown 或 HTML 等結構化格式,同時保留閱讀順序並識別特定內容類型(如標題、表格和公式)。

運作方式

該服務結合了多種機器學習模型來分割和分類 PDF 內容。它提供 Vision Grid Transformer (VGT) 以實現高準確度,或 LightGBM 以實現更快的處理速度。它整合了 Tesseract OCR 以支援超過 150 種語言,並使用 Ollama 驅動的模型將提取的內容自動翻譯成多種目標語言。

適用對象

專為需要以程式化方式從 PDF 中提取結構化資料的開發人員和組織而設計,也適合偏好透過 Gradio 網頁介面進行文件轉換和翻譯的使用者。

特色亮點

  • 多模型分析:可選擇高準確度的 VGT 或高速的 LightGBM 模型。
  • 結構化匯出:將 PDF 轉換為 Markdown 或 HTML,包含公式的 LaTeX 和表格的 HTML。
  • 整合翻譯:使用 Ollama 模型進行自動文件翻譯,同時保留格式。
  • 完整工具鏈:包含 REST API、Gradio 網頁介面以及支援 GPU 加速的 Docker。
  • OCR 功能:支援 150 多種語言,並具備頁面旋轉和校正功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案