robertknight/ocrs

Rust library and CLI tool for OCR (extracting text from images)

何を解決するか

Ocrs は、Tesseract などの古いエンジンで通常必要とされる手動の画像前処理の必要性を減らしながら、画像からテキストを抽出する(OCR)ためのものとして設計されています。さまざまなプラットフォーム、特に WebAssembly でも動作する現代的でコンパイルしやすい OCR エンジンを提供することを目指しています。

動作方法

このプロジェクトは PyTorch で訓練されたニューラルネットワークモデルを使用しており、それらは ONNX 形式にエクスポートされ、RTen エンジンによって実行されます。この機械学習中心のパイプラインにより、スキャンされた文書、スクリーンショット、テキストを含む写真など、さまざまな画像タイプを処理できます。

対象ユーザー

Rust で構築された OCR ライブラリや CLI ツールを必要とする開発者向けです。デプロイが簡単でクロスプラットフォーム互換性があることを重視しています。

特徴

  • クロスプラットフォーム対応: WebAssembly を含む複数のプラットフォームで動作可能。
  • ML駆動のパイプライン: PyTorch と ONNX を使用して前処理の手間を最小限に抑えます。
  • オープンデータセット: オープンで柔軟なライセンスが適用されたデータセットで訓練されています。
  • CLI 機能: ファイルやシステムクリップボードから読み取り、テキスト、JSON レイアウト情報、または注釈付き画像を出力できるコマンドラインツールを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト