baidu/Unlimited-OCR
Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.
何を解決するか
Unlimited-OCR は「ワンショット長距離解析」を目的として設計されており、複雑なドキュメントや長文ドキュメント(PDFなど)を1回の処理で複数ページにわたって処理できるようにします。これにより、Deepseek-OCR などの従来のOCRシステムを上回ります。
動作方法
このプロジェクトは、単一の画像または複数ページのドキュメントを処理できるマルチモーダルモデルを提供します。2つの構成モードをサポートしています:「gundam」(特定の画像サイズとクロッピングに最適化)と「base」(標準的な解析)。Hugging Face Transformers、vLLM(高スループット推論用)、SGLang(OpenAI互換APIを備えたサーバー基盤のデプロイ用)を通じて統合可能です。
対象ユーザー
長文コンテンツ、PDF、複数ページ画像の高精度OCRおよびドキュメント解析を必要とする開発者や研究者。
主な特徴
- 長距離解析: 複数ページドキュメントや長距離コンテンツを特に設計されています。
- 柔軟なデプロイ: Transformers、vLLM、SGLang などの複数の推論エンジンをサポート。
- PDF対応: PDFページを画像に変換する組み込みユーティリティを備え、スムーズな解析を実現。
- 高スループット: SGLang を通じてバッチ推論と並行リクエストをサポート。
関連
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト