huridocs/pdf-document-layout-analysis
A Docker-powered service for PDF document layout analysis. This service provides a powerful and flexible PDF analysis service. The service allows for the segmentation and classification of different parts of PDF pages, identifying the elements such as texts, titles, pictures, tables and so on.
解决的问题
此项目提供了一个用于智能 PDF 版面分析的微服务,让用户能将复杂的 PDF 文档转换为 Markdown 或 HTML 等结构化格式,同时保留阅读顺序并识别特定内容类型(如标题、表格和公式)。
运作方式
该服务结合了多种机器学习模型来分割和分类 PDF 内容。它提供 Vision Grid Transformer (VGT) 以实现高准确度,或 LightGBM 以实现更快的处理速度。它整合了 Tesseract OCR 以支持超过 150 种语言,并使用 Ollama 驱动的模型将提取的内容自动翻译成多种目标语言。
适用对象
专为需要以程序化方式从 PDF 中提取结构化数据的开发人员和组织而设计,也适合偏好通过 Gradio 网页界面进行文档转换和翻译的用户。
特色亮点
- 多模型分析:可选择高准确度的 VGT 或高速的 LightGBM 模型。
- 结构化导出:将 PDF 转换为 Markdown 或 HTML,包含公式的 LaTeX 和表格的 HTML。
- 整合翻译:使用 Ollama 模型进行自动文档翻译,同时保留格式。
- 完整工具链:包含 REST API、Gradio 网页界面以及支持 GPU 加速的 Docker。
- OCR 功能:支持 150 多种语言,并具备页面旋转和校正功能。
相关
- 项目
- 项目
- 项目
- 项目