alephpi/Texo
A minimalist SOTA LaTeX OCR model with only 20M parameters, running in browser. Full training pipeline available for self-reproduction. | 超轻量SOTA LaTeX公式识别模型,仅20M参数量,可在浏览器中运行。训练全流程代码开源,以便自学复现。
What it solves
Texo は軽量でオープンソースの LaTeX OCR モデルで、数式画像を LaTeX コードに変換することを目的としています。手書きや印刷された数式をデジタル化したい STEM 学習者や研究者が、無料で高速、かつ手軽に利用できるツールのニーズに応えます。
How it works
Texo は PPFormulaNet‑S の蒸留版で、UniMERNet‑1M データセットでファインチューニングされています。モデルは PaddleOCR の PPHGNetV2 をベースにしたアーキテクチャを使用し、デコーダとトークナイザには Hugging Face Transformers フレームワークを活用しています。パラメータはわずか 2000 万個に最適化されており、コンシューマー向け GPU だけでなくウェブブラウザ上でも効率的に動作します。
Who it’s for
- STEM 学習者・研究者:数式画像を素早く LaTeX に変換したいユーザー。
- 開発者:アプリケーションに組み込める軽量 OCR モデル、またはブラウザで動作させたい方。
- ML 実務者:OCR タスク向けの蒸留やファインチューニングに関心のある方。
Highlights
- 超軽量:パラメータは 20M だけで、UniMERNet‑T(107M)など他の SOTA モデルに比べて格段に小さいです。
- SOTA パフォーマンス:UniMERNet‑Test データセットにおける BLEU と Edit distance の指標で、より大きなモデルに匹敵します。
- アクセスしやすい:無料・オープンソース(AGPL‑3.0)で、別途提供されるウェブ実装によりブラウザでも利用可能です。
- 学習可能:コンシューマー向け GPU(最低 16GB メモリ)で学習できます。
- 包括的:学習スクリプト、データ正規化ツール、技術レポートが同梱されています。