Yuliang-Liu/MonkeyOCR

A lightweight LMM-based Document Parsing Model

解決する課題

MonkeyOCRは、ドキュメント解析の複雑さ、特にPDFや画像をMarkdownのような構造化された形式に変換する課題を解決するために設計されています。テキスト、数式、表を認識するための、より合理化された高性能なアプローチを提供することで、煩雑なマルチツール・パイプラインや、全ページ処理に大規模なマルチモーダルモデルを使用する非効率性を解消することを目指しています。

仕組み

このプロジェクトは、Structure-Recognition-Relation (SRR) 三組パラダイムを利用しています。このアプローチは、ドキュメントの構造の特定、構造内のコンテンツの認識、および異なるコンテンツブロック間の関係の決定という3つのコアコンポーネントに焦点を当てることで、解析プロセスを簡素化します。英語と中国語の両方のドキュメントをサポートしており、速度と精度のバランスをとるために異なるモデルサイズ(例:1.2Bおよび3Bパラメータ)を提供しています。

対象者

このツールは、複雑なドキュメント(PDFまたは画像)を構造化された機械読み取り可能なテキストに変換する必要がある開発者や研究者、特に数式や表を含む多言語(英語および中国語)のドキュメントを扱う方を対象としています。

ハイライト

  • 高いパフォーマンス: OmniDocBenchベンチマークにおいて、いくつかのクローズソースおよび大規模なオープンソースVLM(GPT-4oやGemini 2.0-Flashなど)を凌駕しています。
  • 柔軟なデプロイ: 幅広いGPU(4060からH800まで)をサポートし、Dockerデプロイオプションを提供しています。
  • 包括的な出力: 処理されたMarkdownファイル、レイアウトPDF、およびブロックの座標と関係を含む詳細な中間JSON結果を生成します。
  • 効率的なスケーリング: 1.2Bモデルは、パフォーマンスの低下を最小限に抑えつつ、3Bバージョンと比較して大幅な速度向上(約36%)を実現しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト