datalab-to/surya

OCR, layout analysis, reading order, table recognition in 90+ languages

解决的问题

Surya 是一个高精度、多语言 OCR(光学字符识别)和文档智能工具。它解决了将包含表格、公式和复杂布局的复杂文档转换为结构化、机器可读的文本和 HTML 的问题,支持 91 种语言。

工作原理

Surya 使用一个 650M 参数的视觉语言模型(VLM)来执行布局分析、文本识别和表格识别。它可以通过推理管理器部署,该管理器会自动使用 vllm(适用于 NVIDIA GPU)或 llama.cpp(适用于 CPU 和 Apple Silicon)启动后端服务器。系统可以处理整页或特定文本块,将其转换为 HTML(包括支持 KaTeX 的 LaTeX 用于数学公式),并为每个元素提供精确的边界框。

适用人群

专为需要从 PDF、图像和扫描文档中提取结构化数据的开发者和研究人员设计,尤其适用于包含复杂格式的文档,如教科书、税务表格和企业文档。

主要亮点

  • 多语言支持:在 91 种不同语言中均实现高精度。
  • 文档智能:执行布局分析(标题、页脚、图注)和阅读顺序检测。
  • 表格识别:提取表格结构(包括行和列),并可输出完整的 HTML 表格。
  • 数学支持:识别内联公式,并以 KaTeX 兼容的 LaTeX 格式输出。
  • 灵活的推理:支持 GPU(通过 vllm)和 CPU/Apple Silicon(通过 llama.cpp)后端。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目