TW-NLP/ChineseErrorCorrector
一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )
何を解決するか
このプロジェクトは、Chinese Spelling Correction (CSC) と Chinese Grammatical Error Correction (CGEC) の両方に対処する、中国語テキスト修正のための包括的なプラットフォームを提供します。中国語テキストにおけるタイポ、単語の不整合、および複雑な文法エラーを特定して修正する問題を解決し、専門的なベンチマークにおいて GPT-4 のような汎用モデルを凌駕する性能を発揮します。
仕組み
このプラットフォームは、高精度な修正を実現するために、いくつかのコンポーネントを統合しています:
- Pre-trained Models: 数百万の教師ありサンプルと Chain-of-Thought (COT) データでトレーニングされた一連の専門化されたモデル(例:
ChineseErrorCorrector4-4B)が、修正の根拠を提供します。 - Inference Pipeline:
transformers、高スループットなバッチ処理のためのvLLM、および中国国内向けのミラーサイトであるmodelscopeを介したデプロイメントをサポートしています。 - Efficiency Gating: オプションの軽量な
ELECTRAベースの検出器をゲートとして使用し、エラーの可能性がある文を、より大きな 4B モデルを呼び出す前に特定することで、計算コストを削減できます。 - Data Augmentation: 14 種類の文法エラーを合成して、ドメイン固有の修正モデル用のトレーニングデータを作成できるツールです。
対象者
- Researchers: NLP とテキスト修正を研究している人々で、厳選された論文リスト、評価ツール(Common Errant)、および SOTA ベンチマークへのアクセスが必要な方。
- Developers: API またはローカルデプロイメントを通じて、高性能な中国語エラー修正をアプリケーションに統合したいエンジニア。
- ML Engineers: 提供された拡張ツールと LLaMA-Factory を使用して、独自のデータで修正モデルを微調整したい実務家。
ハイライト
- SOTA Performance:
ChineseErrorCorrector4-4Bモデルは、NACGEC および CSCD ベンチマークにおいて SOTA(最先端)の結果を達成し、GPT-4 を上回っています。 - Comprehensive Toolset: モデルの重み、評価ツール、およびデータ拡張を一つのリポジトリにまとめています。
- Transparent Reasoning: 最新のモデルは、修正されたテキストだけでなく、エラーの種類と修正の理由も提供します。
- Data Resources: 200万の教師ありサンプルと 34万の COT サンプルを含む、大規模なデータセットをオープンソース化しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト