TW-NLP/ChineseErrorCorrector
一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )
해결하는 문제
이 프로젝트는 중국어 문장 수정을 위한 포괄적인 플랫폼을 제공하며, 중국어 철자 오류 수정 (CSC) 과 중국어 문법 오류 수정 (CGEC) 를 모두 다룹니다. 일반적인 모델(GPT-4 등)보다 전문 벤치마크에서 더 뛰어난 성능을 발휘하여 중국어 텍스트 내의 오타, 단어 오류, 복잡한 문법 오류를 식별하고 수정합니다.
작동 방식
정확도 높은 수정을 위해 여러 구성 요소를 통합합니다:
- 사전 학습 모델: 수백만 개의 감독 샘플과 Chain-of-Thought (COT) 데이터로 훈련된 전용 모델(예:
ChineseErrorCorrector4-4B)로 수정의 근거를 제공합니다. - 추론 파이프라인:
transformers,vLLM을 통한 고처리량 배치 처리,modelscope를 통한 국내 미러 배포를 지원합니다. - 효율성 게이팅: 계산 비용을 줄이기 위해 경량
ELECTRA기반 검출기로 오류 가능성이 있는 문장을 사전에 식별하고, 대규모 4B 모델 호출 전에 필터링할 수 있습니다. - 데이터 증강: 14가지 유형의 문법 오류를 합성하여 도메인 특화 수정 모델을 위한 학습 데이터를 생성할 수 있는 도구를 제공합니다.
대상 사용자
- 연구자: NLP 및 텍스트 수정을 연구하는 분들로, 큐레이션된 논문 목록, 평가 도구(Common Errant), 최신 벤치마크에 접근이 필요합니다.
- 개발자: API 또는 로컬 배포를 통해 고성능 중국어 오류 수정 기능을 애플리케이션에 통합하고자 하는 엔지니어.
- ML 엔지니어: 제공된 증강 도구와 LLaMA-Factory를 사용해 자체 데이터로 수정 모델을 파인튜닝하고자 하는 실무자.
주요 특징
- 최고 수준 성능:
ChineseErrorCorrector4-4B모델은 NACGEC 및 CSCD 벤치마크에서 최고 성능을 기록하며, GPT-4를 초월합니다. - 포괄적인 도구 세트: 모델 가중치, 평가 도구, 데이터 증강 기능을 하나의 리포지토리에 통합했습니다.
- 투명한 추론: 최신 모델은 수정된 텍스트뿐 아니라 오류 유형과 수정 이유도 제공합니다.
- 데이터 자원: 200만 개의 감독 샘플과 34만 개의 COT 샘플을 포함한 대규모 데이터셋을 오픈소스로 공개합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트