xiaofengShi/CHINESE-OCR

End-to-end Chinese scene-text detection and recognition with CTPN, CRNN, and CTC (legacy project).

何を解決するか

このプロジェクトは、自然なシーン画像における中国語テキストの検出と認識のためのパイプラインを提供し、テキストの向きの変化や長さの異なるテキスト文字列といった課題に対処します。

動作方法

システムは3段階のネットワークアーキテクチャを使用しています:

  1. テキスト向き検出:VGG16ベースの分類器で、テキストが0、90、180、270度回転しているかどうかを検出します。
  2. テキスト領域検出:水平テキスト領域のバウンディングボックスを特定するCTPN(CNN+RNN)ネットワーク。
  3. エンドツーエンド認識:検出された領域内の実際の文字を、個々の文字を分離する必要なく認識するCRNN(CNN+GRU/LSTM+CTC)ネットワーク。

対象ユーザー

中国語テキスト向け光学式文字認識(OCR)に興味がある研究者や開発者。特にTensorFlow 1.x、Keras、またはPyTorchを使用した歴史的な実装を探している人向けです。

特徴

  • マルチステージパイプライン:向き検出、領域定位、文字認識を統合しています。
  • C-T-C損失:変動する長さのテキストを手動の文字レベルの分割なしで認識するため、接続主義時系列分類(CTC)を使用しています。
  • フレキシブルなフレームワーク:KerasおよびPyTorchの両方の学習コードを提供しています。
  • 包括的なデータセットガイド:中国語テキスト検出および認識モデルの学習に適した大規模な公開データセットのリストを収録しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト