huridocs/pdf-document-layout-analysis

A Docker-powered service for PDF document layout analysis. This service provides a powerful and flexible PDF analysis service. The service allows for the segmentation and classification of different parts of PDF pages, identifying the elements such as texts, titles, pictures, tables and so on.

解決する課題

このプロジェクトは、インテリジェントなPDFレイアウト解析のためのマイクロサービスを提供します。複雑なPDFドキュメントをMarkdownやHTMLなどの構造化された形式に変換し、読み取り順序を維持しながら、タイトル、表、数式などの特定のコンテンツタイプを識別できます。

仕組み

このサービスは、機械学習モデルを組み合わせてPDFコンテンツをセグメント化および分類します。高精度なVision Grid Transformer (VGT) と、高速処理が可能なLightGBMのいずれかを選択できます。Tesseract OCRを統合して150以上の言語をサポートし、Ollamaベースのモデルを使用して抽出されたコンテンツを複数のターゲット言語に自動翻訳します。

対象ユーザー

PDFから構造化データをプログラムで抽出する必要がある開発者や組織、およびGradio Web UIを介したドキュメント変換と翻訳を好むユーザー向けに設計されています。

主な特徴

  • マルチモデル解析: 高精度なVGTモデルまたは高速なLightGBMモデルを選択可能。
  • 構造化エクスポート: PDFをMarkdownまたはHTMLに変換。数式にはLaTeX、表にはHTMLを使用。
  • 統合翻訳: Ollamaモデルを使用した自動ドキュメント翻訳。フォーマットを維持したまま翻訳可能。
  • 包括的なツール: REST API、Gradio Webインターフェース、GPUアクセラレーション対応のDockerを同梱。
  • OCR機能: 150以上の言語をサポートし、ページの回転や傾き補正機能を備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト