Yuliang-Liu/MultimodalOCR

On the Hidden Mystery of OCR in Large Multimodal Models (OCRBench)

何を解決するか

このリポジトリは、Large Multimodal Models (LMMs) が視覚的テキストをどのように処理するかを評価するためのベンチマークスイートを提供します。多言語ドキュメント解析、実世界の写真撮影されたドキュメント、および多様な文字体系と言語における複雑な視覚的テキストの局所化と推論タスクに対する体系的な評価の不足に対処しています。

仕組み

このプロジェクトは3つの主要なベンチマークから構成されています。

  • MDPBench: 17の言語と多様な文字体系をカバーする多言語ドキュメント解析に焦点を当て、クリーンなデジタルページと実世界の写真撮影されたドキュメントの両方でモデルをテストします。
  • OCRBench v2: 10,000のヒューマン検証済みQAペアを使用して、31の多様なシナリオ(領収書、数式、街の風景など)における視覚的テキストの局所化と推論を検証する大規模な二言語ベンチマークです。
  • OCRBench: コアOCR機能を評価する元のベンチマークで、テキスト認識、シーンテキストVQA、ドキュメントVQA、重要な情報抽出、および手書きの数学式認識を含みます。

対象ユーザー

光学文字認識(OCR)およびドキュメント理解タスクにおける性能を測定したい、Large Multimodal Models (LMMs) の開発や評価に取り組む研究者や開発者向けです。

特徴

  • 多言語カバー範囲: MDPBenchは、低リソース言語やローマ字以外の文字体系を含む17の言語をカバーしています。
  • 実世界テスト: 写真撮影されたドキュメントとデジタルドキュメントの性能を特に評価しています。
  • 包括的なシナリオ: OCRBench v2は31の異なる視覚的テキストシナリオをカバーしています。
  • ヒューマン検証済み: すべてのベンチマークは高品質なヒューマン検証済みアノテーションを使用しており、正確な評価を保証しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch