TW-NLP/ChineseErrorCorrector
一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )
解决的问题
本项目提供一个全面的中文文本修正平台,涵盖 中文拼写纠错 (CSC) 和 中文语法错误纠正 (CGEC)。它解决了在中文文本中识别和修复错别字、词语错位及复杂语法错误的问题,在专业基准测试中表现优于通用模型(如 GPT-4)。
工作原理
平台整合多个组件以实现高精度修正:
- 预训练模型:一系列专用模型(如
ChineseErrorCorrector4-4B),基于数百万条监督样本和 Chain-of-Thought (COT) 数据训练,提供修正的推理过程。 - 推理流水线:支持通过
transformers、vLLM实现高吞吐量批量处理,以及通过modelscope实现国内镜像部署。 - 效率门控:可选的轻量级
ELECTRA基础检测器可用作门控,提前识别潜在错误句子,再调用大型 4B 模型,从而降低计算成本。 - 数据增强:一个工具可合成 14 种语法错误类型,用于生成特定领域修正模型的训练数据。
适用人群
- 研究人员:从事 NLP 和文本纠错研究者,需要访问精选论文列表、评估工具(Common Errant)和 SOTA 基准测试。
- 开发者:希望通过 API 或本地部署将高性能中文纠错功能集成到应用中的工程师。
- 机器学习工程师:希望使用提供的增强工具和 LLaMA-Factory 在自有数据上微调纠错模型的实践者。
核心亮点
- SOTA 性能:
ChineseErrorCorrector4-4B模型在 NACGEC 和 CSCD 基准测试中达到最先进水平,超越 GPT-4。 - 全面工具集:将模型权重、评估工具和数据增强功能整合于一个仓库中。
- 透明推理:最新模型不仅提供修正后的文本,还输出错误类型和修改原因。
- 数据资源:开源大规模数据集,包括 200 万条监督样本和 34 万条 COT 样本。
相关
- 项目
- 项目
- 项目
- 项目
- 项目