alephpi/Texo

A minimalist SOTA LaTeX OCR model with only 20M parameters, running in browser. Full training pipeline available for self-reproduction. | 超轻量SOTA LaTeX公式识别模型,仅20M参数量,可在浏览器中运行。训练全流程代码开源,以便自学复现。

What it solves

Texo は軽量でオープンソースの LaTeX OCR モデルで、数式画像を LaTeX コードに変換することを目的としています。手書きや印刷された数式をデジタル化したい STEM 学習者や研究者が、無料で高速、かつ手軽に利用できるツールのニーズに応えます。

How it works

Texo は PPFormulaNet‑S の蒸留版で、UniMERNet‑1M データセットでファインチューニングされています。モデルは PaddleOCR の PPHGNetV2 をベースにしたアーキテクチャを使用し、デコーダとトークナイザには Hugging Face Transformers フレームワークを活用しています。パラメータはわずか 2000 万個に最適化されており、コンシューマー向け GPU だけでなくウェブブラウザ上でも効率的に動作します。

Who it’s for

  • STEM 学習者・研究者:数式画像を素早く LaTeX に変換したいユーザー。
  • 開発者:アプリケーションに組み込める軽量 OCR モデル、またはブラウザで動作させたい方。
  • ML 実務者:OCR タスク向けの蒸留やファインチューニングに関心のある方。

Highlights

  • 超軽量:パラメータは 20M だけで、UniMERNet‑T(107M)など他の SOTA モデルに比べて格段に小さいです。
  • SOTA パフォーマンス:UniMERNet‑Test データセットにおける BLEU と Edit distance の指標で、より大きなモデルに匹敵します。
  • アクセスしやすい:無料・オープンソース(AGPL‑3.0)で、別途提供されるウェブ実装によりブラウザでも利用可能です。
  • 学習可能:コンシューマー向け GPU(最低 16GB メモリ)で学習できます。
  • 包括的:学習スクリプト、データ正規化ツール、技術レポートが同梱されています。