alephpi/Texo

A minimalist SOTA LaTeX OCR model with only 20M parameters, running in browser. Full training pipeline available for self-reproduction. | 超轻量SOTA LaTeX公式识别模型,仅20M参数量,可在浏览器中运行。训练全流程代码开源,以便自学复现。

What it solves

Texo 是一个轻量、开源的 LaTeX OCR 模型,旨在将数学公式图片转换为 LaTeX 代码。它解决了 STEM 学习者和研究人员需要免费、快速且易获取的工具,以数字化手写或印刷的数学表达式的需求。

How it works

Texo 是 PPFormulaNet‑S 模型的蒸馏版,在 UniMERNet‑1M 数据集上进行微调。它使用基于 PaddleOCR 的 PPHGNetV2 架构,并利用 Hugging Face Transformers 框架作为解码器和分词器。模型高度优化,仅有 20 百万参数,能够在消费级 GPU 甚至浏览器中高效运行。

Who it’s for

  • STEM 学习者和研究人员:需要快速将数学图片转成 LaTeX 的用户。
  • 开发者:寻找可集成到应用或在浏览器中运行的轻量 OCR 模型。
  • 机器学习实践者:对蒸馏和微调专用 OCR 任务感兴趣的个人。

Highlights

  • 超轻量:仅 20M 参数,远小于 UniMERNet‑T(107M)等其他 SOTA 模型。
  • SOTA 性能:在 UniMERNet‑Test 数据集上 BLEU 与 Edit distance 指标上与更大模型相当。
  • 易获取:免费且开源(AGPL‑3.0),可通过独立的网页实现在浏览器中运行。
  • 可训练:可在消费级 GPU(最低 16G 显存)上进行训练。
  • 完整套件:包括训练脚本、数据归一化工具和技术报告。