datalab-to/surya
OCR, layout analysis, reading order, table recognition in 90+ languages
解决的问题
Surya 是一个高精度、多语言 OCR(光学字符识别)和文档智能工具。它解决了将包含表格、公式和复杂布局的复杂文档转换为结构化、机器可读的文本和 HTML 的问题,支持 91 种语言。
工作原理
Surya 使用一个 650M 参数的视觉语言模型(VLM)来执行布局分析、文本识别和表格识别。它可以通过推理管理器部署,该管理器会自动使用 vllm(适用于 NVIDIA GPU)或 llama.cpp(适用于 CPU 和 Apple Silicon)启动后端服务器。系统可以处理整页或特定文本块,将其转换为 HTML(包括支持 KaTeX 的 LaTeX 用于数学公式),并为每个元素提供精确的边界框。
适用人群
专为需要从 PDF、图像和扫描文档中提取结构化数据的开发者和研究人员设计,尤其适用于包含复杂格式的文档,如教科书、税务表格和企业文档。
主要亮点
- 多语言支持:在 91 种不同语言中均实现高精度。
- 文档智能:执行布局分析(标题、页脚、图注)和阅读顺序检测。
- 表格识别:提取表格结构(包括行和列),并可输出完整的 HTML 表格。
- 数学支持:识别内联公式,并以 KaTeX 兼容的 LaTeX 格式输出。
- 灵活的推理:支持 GPU(通过
vllm)和 CPU/Apple Silicon(通过llama.cpp)后端。
相关
- 项目
- 项目
- 项目
- 项目
- 项目