datalab-to/surya

OCR, layout analysis, reading order, table recognition in 90+ languages

何を解決するか

Surya は高精度で多言語対応の OCR(光学式文字認識)およびドキュメントインテリジェンスツールです。テーブル、数式、多様なレイアウトを含む複雑なドキュメントを、91言語をサポートする構造化された機械可読テキストおよび HTML に変換する問題を解決します。

動作方法

Surya は 650M パラメータのビジョン言語モデル(VLM)を使用して、レイアウト分析、テキスト認識、テーブル認識を実行します。vllm(NVIDIA GPU用)または llama.cpp(CPUおよびApple Silicon用)を用いて、インフェンスマネージャーが自動的にバックエンドサーバーを起動できます。システムはページ全体または特定のテキストブロックを処理でき、HTML(数式用にKaTeX互換のLaTeXを含む)に変換し、すべての要素に対して正確なバウンディングボックスを提供します。

対象ユーザー

PDF、画像、スキャンされたドキュメントから構造化データを抽出する必要がある開発者や研究者向けです。特に教科書、税務申告書、企業文書など、複雑なフォーマットを含むドキュメントを扱う場合に適しています。

特徴

  • 多言語対応:91の異なる言語で高精度な認識を実現。
  • ドキュメントインテリジェンス:レイアウト分析(見出し、フッター、キャプション)および読み順検出を実行。
  • テーブル認識:テーブル構造(行と列)を抽出でき、完全なHTMLテーブルとして出力可能。
  • 数式対応:インライン数式を認識し、KaTeX互換のLaTeX形式で出力。
  • 柔軟なインフェンス:GPU(vllm経由)およびCPU/Apple Silicon(llama.cpp経由)の両方をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト