TW-NLP/ChineseErrorCorrector

一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )

解決的問題

本專案提供一個全面的中文文本修正平台,涵蓋 中文拼字修正 (CSC)中文文法錯誤修正 (CGEC)。它解決了識別與修復中文文本中的拼字錯誤、詞語錯位與複雜文法錯誤的問題,在專業基準測試中表現優於通用模型(如 GPT-4)。

工作原理

平台整合多個組件以實現高精度修正:

  • 預訓練模型:一系列在數百萬監督樣本與 Chain-of-Thought (COT) 數據上訓練的專用模型(如 ChineseErrorCorrector4-4B),可提供修正的推理過程。
  • 推理流程:支援透過 transformersvLLM 實現高吞吐量批次處理,以及透過 modelscope 部署國內鏡像。
  • 效率門控:可選的輕量級 ELECTRA 基礎檢測器可用作門控,提前識別潛在錯誤句子,再呼叫大型 4B 模型,從而降低計算成本。
  • 資料增強:可合成 14 種語法錯誤類型,用於生成特定領域修正模型的訓練資料。

適用對象

  • 研究人員:從事 NLP 與文本修正研究者,需要存取精選論文清單、評估工具(Common Errant)與 SOTA 基準測試。
  • 開發者:希望透過 API 或本地部署將高性能量中文錯誤修正功能整合至應用中的工程師。
  • 機器學習工程師:希望使用提供的增強工具與 LLaMA-Factory 在自有資料上微調修正模型的實務者。

核心亮點

  • SOTA 性能ChineseErrorCorrector4-4B 模型在 NACGEC 與 CSCD 基準測試中達成最尖端水準,超越 GPT-4。
  • 全面工具集:將模型權重、評估工具與資料增強功能整合於一個倉儲中。
  • 透明推理:最新模型不僅輸出修正後的文本,還提供錯誤類型與修改原因。
  • 資料資源:開源大型資料集,包含 200 萬筆監督樣本與 34 萬筆 COT 樣本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案