datalab-to/surya

OCR, layout analysis, reading order, table recognition in 90+ languages

解決的問題

Surya 是一個高精度、多語言 OCR(光學字元辨識)與文件智慧工具。它解決了將包含表格、公式與多樣化版面的複雜文件,轉換為結構化、機器可讀的文本與 HTML 的問題,支援 91 種語言。

工作原理

Surya 使用 650M 參數的視覺語言模型(VLM)執行版面分析、文字辨識與表格辨識。可透過推理管理器部署,該管理器會自動使用 vllm(適用於 NVIDIA GPU)或 llama.cpp(適用於 CPU 與 Apple Silicon)啟動後端伺服器。系統可處理整頁或特定文字區塊,轉換為 HTML(包含支援 KaTeX 的 LaTeX 用於數學公式),並為每個元素提供精確的邊界框。

適用對象

專為需要從 PDF、影像與掃描文件中提取結構化資料的開發者與研究人員設計,特別適用於包含複雜格式的文件,如教科書、稅務申報表與企業文件。

主要特色

  • 多語言支援:在 91 種不同語言中皆具高準確度。
  • 文件智慧:執行版面分析(標題、頁尾、圖說)與閱讀順序偵測。
  • 表格辨識:提取表格結構(包含列與行),並可輸出完整的 HTML 表格。
  • 數學支援:辨識內嵌公式,並以 KaTeX 相容的 LaTeX 格式輸出。
  • 彈性推理:支援 GPU(透過 vllm)與 CPU/Apple Silicon(透過 llama.cpp)後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案