TW-NLP/ChineseErrorCorrector

一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )

何を解決するか

このプロジェクトは、Chinese Spelling Correction (CSC)Chinese Grammatical Error Correction (CGEC) の両方に対処する、中国語テキスト修正のための包括的なプラットフォームを提供します。中国語テキストにおけるタイポ、単語の不整合、および複雑な文法エラーを特定して修正する問題を解決し、専門的なベンチマークにおいて GPT-4 のような汎用モデルを凌駕する性能を発揮します。

仕組み

このプラットフォームは、高精度な修正を実現するために、いくつかのコンポーネントを統合しています:

  • Pre-trained Models: 数百万の教師ありサンプルと Chain-of-Thought (COT) データでトレーニングされた一連の専門化されたモデル(例:ChineseErrorCorrector4-4B)が、修正の根拠を提供します。
  • Inference Pipeline: transformers、高スループットなバッチ処理のための vLLM、および中国国内向けのミラーサイトである modelscope を介したデプロイメントをサポートしています。
  • Efficiency Gating: オプションの軽量な ELECTRA ベースの検出器をゲートとして使用し、エラーの可能性がある文を、より大きな 4B モデルを呼び出す前に特定することで、計算コストを削減できます。
  • Data Augmentation: 14 種類の文法エラーを合成して、ドメイン固有の修正モデル用のトレーニングデータを作成できるツールです。

対象者

  • Researchers: NLP とテキスト修正を研究している人々で、厳選された論文リスト、評価ツール(Common Errant)、および SOTA ベンチマークへのアクセスが必要な方。
  • Developers: API またはローカルデプロイメントを通じて、高性能な中国語エラー修正をアプリケーションに統合したいエンジニア。
  • ML Engineers: 提供された拡張ツールと LLaMA-Factory を使用して、独自のデータで修正モデルを微調整したい実務家。

ハイライト

  • SOTA Performance: ChineseErrorCorrector4-4B モデルは、NACGEC および CSCD ベンチマークにおいて SOTA(最先端)の結果を達成し、GPT-4 を上回っています。
  • Comprehensive Toolset: モデルの重み、評価ツール、およびデータ拡張を一つのリポジトリにまとめています。
  • Transparent Reasoning: 最新のモデルは、修正されたテキストだけでなく、エラーの種類と修正の理由も提供します。
  • Data Resources: 200万の教師ありサンプルと 34万の COT サンプルを含む、大規模なデータセットをオープンソース化しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト