TW-NLP/ChineseErrorCorrector
一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )
解決的問題
本專案提供一個全面的中文文本修正平台,涵蓋 中文拼字修正 (CSC) 與 中文文法錯誤修正 (CGEC)。它解決了識別與修復中文文本中的拼字錯誤、詞語錯位與複雜文法錯誤的問題,在專業基準測試中表現優於通用模型(如 GPT-4)。
工作原理
平台整合多個組件以實現高精度修正:
- 預訓練模型:一系列在數百萬監督樣本與 Chain-of-Thought (COT) 數據上訓練的專用模型(如
ChineseErrorCorrector4-4B),可提供修正的推理過程。 - 推理流程:支援透過
transformers、vLLM實現高吞吐量批次處理,以及透過modelscope部署國內鏡像。 - 效率門控:可選的輕量級
ELECTRA基礎檢測器可用作門控,提前識別潛在錯誤句子,再呼叫大型 4B 模型,從而降低計算成本。 - 資料增強:可合成 14 種語法錯誤類型,用於生成特定領域修正模型的訓練資料。
適用對象
- 研究人員:從事 NLP 與文本修正研究者,需要存取精選論文清單、評估工具(Common Errant)與 SOTA 基準測試。
- 開發者:希望透過 API 或本地部署將高性能量中文錯誤修正功能整合至應用中的工程師。
- 機器學習工程師:希望使用提供的增強工具與 LLaMA-Factory 在自有資料上微調修正模型的實務者。
核心亮點
- SOTA 性能:
ChineseErrorCorrector4-4B模型在 NACGEC 與 CSCD 基準測試中達成最尖端水準,超越 GPT-4。 - 全面工具集:將模型權重、評估工具與資料增強功能整合於一個倉儲中。
- 透明推理:最新模型不僅輸出修正後的文本,還提供錯誤類型與修改原因。
- 資料資源:開源大型資料集,包含 200 萬筆監督樣本與 34 萬筆 COT 樣本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案