TW-NLP/ChineseErrorCorrector

一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )

해결하는 문제

이 프로젝트는 중국어 문장 수정을 위한 포괄적인 플랫폼을 제공하며, 중국어 철자 오류 수정 (CSC)중국어 문법 오류 수정 (CGEC) 를 모두 다룹니다. 일반적인 모델(GPT-4 등)보다 전문 벤치마크에서 더 뛰어난 성능을 발휘하여 중국어 텍스트 내의 오타, 단어 오류, 복잡한 문법 오류를 식별하고 수정합니다.

작동 방식

정확도 높은 수정을 위해 여러 구성 요소를 통합합니다:

  • 사전 학습 모델: 수백만 개의 감독 샘플과 Chain-of-Thought (COT) 데이터로 훈련된 전용 모델(예: ChineseErrorCorrector4-4B)로 수정의 근거를 제공합니다.
  • 추론 파이프라인: transformers, vLLM을 통한 고처리량 배치 처리, modelscope를 통한 국내 미러 배포를 지원합니다.
  • 효율성 게이팅: 계산 비용을 줄이기 위해 경량 ELECTRA 기반 검출기로 오류 가능성이 있는 문장을 사전에 식별하고, 대규모 4B 모델 호출 전에 필터링할 수 있습니다.
  • 데이터 증강: 14가지 유형의 문법 오류를 합성하여 도메인 특화 수정 모델을 위한 학습 데이터를 생성할 수 있는 도구를 제공합니다.

대상 사용자

  • 연구자: NLP 및 텍스트 수정을 연구하는 분들로, 큐레이션된 논문 목록, 평가 도구(Common Errant), 최신 벤치마크에 접근이 필요합니다.
  • 개발자: API 또는 로컬 배포를 통해 고성능 중국어 오류 수정 기능을 애플리케이션에 통합하고자 하는 엔지니어.
  • ML 엔지니어: 제공된 증강 도구와 LLaMA-Factory를 사용해 자체 데이터로 수정 모델을 파인튜닝하고자 하는 실무자.

주요 특징

  • 최고 수준 성능: ChineseErrorCorrector4-4B 모델은 NACGEC 및 CSCD 벤치마크에서 최고 성능을 기록하며, GPT-4를 초월합니다.
  • 포괄적인 도구 세트: 모델 가중치, 평가 도구, 데이터 증강 기능을 하나의 리포지토리에 통합했습니다.
  • 투명한 추론: 최신 모델은 수정된 텍스트뿐 아니라 오류 유형과 수정 이유도 제공합니다.
  • 데이터 자원: 200만 개의 감독 샘플과 34만 개의 COT 샘플을 포함한 대규모 데이터셋을 오픈소스로 공개합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트