baidu/Unlimited-OCR
Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.
解决的问题
Unlimited-OCR 专为「一次完成长距离解析」而设计,能够单次处理跨多页的复杂文档或长文档(如 PDF),相比之前的 OCR 系统(如 Deepseek-OCR)有显著提升。
工作原理
该项目提供一个可处理单张图像或多页文档的多模态模型。支持两种配置模式:"gundam"(针对特定图像尺寸和裁剪优化)和 "base"(标准解析)。可通过 Hugging Face Transformers、vLLM(用于高吞吐量推理)或 SGLang(支持 OpenAI 兼容 API 的服务器部署)进行集成。
适用人群
需要对长篇内容、PDF 和多页图像进行高精度 OCR 与文档解析的开发者和研究人员。
主要亮点
- 长距离解析:专为处理多页文档和长距离内容而设计。
- 灵活部署:支持多种推理引擎,包括 Transformers、vLLM 和 SGLang。
- PDF 支持:内置工具可将 PDF 页面转换为图像,实现无缝解析。
- 高吞吐量:通过 SGLang 支持批量推理和并发请求。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- 项目