datalab-to/marker

Convert PDF to markdown + JSON quickly with high accuracy

解決する課題

Markerは、PDF、画像、PPTX、DOCX、XLSX、HTML、EPUBファイルを含む複雑なドキュメントを、Markdown、JSON、HTML、およびチャンクなどのクリーンで構造化された形式に変換します。特に、テーブル、数式、マルチカラムレイアウト、スキャンされたページを含むドキュメントから構造化データを抽出する際の困難さを解決し、ヘッダーやフッターなどの不要なアーティファクトを除去します。

仕組み

Markerは、ドキュメントインテリジェンスに対してハイブリッドなアプローチを採用しています。レイアウト検出とOCRには、Suryaと呼ばれる特化したVLM (Vision Language Model) を使用します。設定に応じて、主に2つのモードで動作します:

  • Balanced Mode: GPU向けに最適化されており、最高品質を確保するために、レイアウト検出と必要な場合のフルページOCRにVLMを使用します。
  • Fast Mode: CPU向けに最適化されており、テキストレイヤーを優先し、数式や文字化けの修正のために最小限のVLMを使用します。

最大限の精度を得るために、ユーザーはLLM (Gemini、Claude、OpenAIなど) を渡して、出力を洗練させ、ページをまたいでテーブルを結合し、フォーム抽出を改善する「Hybrid Mode」を有効にすることができます。

対象ユーザー

Markerは、RAG (Retrieval-Augmented Generation) やデータセット作成などの後続のAIタスクのために、大量のドキュメントを多言語にわたって機械読み取り可能な形式に変換する必要がある開発者やデータサイエンティスト向けに設計されています。

ハイライト

  • マルチフォーマット対応: PDF、画像、Officeドキュメント、EPUBを処理。
  • 高品質な抽出: テーブル、インライン数式 (LaTeX)、コードブロックを正確にフォーマット。
  • 柔軟なデプロイ: vLLMやllama.cppなどのバックエンドを使用して、GPU、CPU、またはApple Silicon (MPS) 上で動作。
  • LLM統合: 複雑なフォーマットにおいてより高い精度を得るための、オプションのLLMベースのブースト機能。
  • 拡張性: ユーザーがカスタムのフォーマットロジックやプロセッサを提供可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト