baidu/Unlimited-OCR

Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.

何を解決するか

Unlimited-OCR は「ワンショット長距離解析」を目的として設計されており、複雑なドキュメントや長文ドキュメント(PDFなど)を1回の処理で複数ページにわたって処理できるようにします。これにより、Deepseek-OCR などの従来のOCRシステムを上回ります。

動作方法

このプロジェクトは、単一の画像または複数ページのドキュメントを処理できるマルチモーダルモデルを提供します。2つの構成モードをサポートしています:「gundam」(特定の画像サイズとクロッピングに最適化)と「base」(標準的な解析)。Hugging Face Transformers、vLLM(高スループット推論用)、SGLang(OpenAI互換APIを備えたサーバー基盤のデプロイ用)を通じて統合可能です。

対象ユーザー

長文コンテンツ、PDF、複数ページ画像の高精度OCRおよびドキュメント解析を必要とする開発者や研究者。

主な特徴

  • 長距離解析: 複数ページドキュメントや長距離コンテンツを特に設計されています。
  • 柔軟なデプロイ: Transformers、vLLM、SGLang などの複数の推論エンジンをサポート。
  • PDF対応: PDFページを画像に変換する組み込みユーティリティを備え、スムーズな解析を実現。
  • 高スループット: SGLang を通じてバッチ推論と並行リクエストをサポート。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト