dongrixinyu/JioNLP

中文 NLP 预处理、解析工具包,准确、高效、易用 A Chinese NLP Preprocessing & Parsing Package www.jionlp.com

해결하는 문제

JioNLP는 중국어 자연어 처리(NLP) 전처리 및 구문 분석에서 반복적이고 시간이 많이 소요되는 작업을 처리하도록 설계되었습니다. 일반적으로 광범위한 수동 코드 작성이 필요했던 데이터 정제, 추출, 분석 작업을 자동화함으로써 개발 속도를 가속화하는 포괄적인 도구 세트를 제공합니다.

작동 방식

이 라이브러리는 다양한 NLP 단계에 특화된 다양한 기능을 제공합니다.

  • 가젯: 번호판, 시간 의미, 신분증, 위치 정보를 파싱하는 도구, 간체자와 번체자 간 변환, 문자를 피니음으로 변환하는 기능 포함.
  • 데이터 증강: 백트랜슬레이션, 동음이의어 대체, NER 엔티티 교체를 포함한 텍스트 증강 방법.
  • 정규 표현식 추출: 이메일, URL, 전화번호, IP 주소와 같은 특정 패턴의 추출 또는 제거를 위한 텍스트 정제 도구.
  • NER 및 분류: 명명된 엔티티 인식(NER) 태그 변환, 데이터셋 분할, 텍스트 분류를 위한 나이브 베이즈 빈도 분석 도구.
  • 어휘 사전: 정지어, 관용구, 중국 지리 정보를 로드하기 위한 내장 로더.
  • LLM 평가: 인간의 감독 없이 대규모 언어 모델(LLM)을 자동 평가하는 알고리즘인 MELLM(Mutual Evaluation of Large Language Models) 포함.

대상 사용자

중국어 텍스트 데이터를 다루는 NLP 개발자 및 연구자로, 효율적이고 고정확도의 전처리 및 구문 분석 도구가 필요한 분들을 주요 대상으로 합니다.

주요 특징

  • 풍부한 중국어 전용 도구: 중국 신분증, 번호판, 지리 정보에 대한 깊이 있는 지원.
  • LLM 평가: 대규모 언어 모델을 위한 통합된 자동 평가 기능.
  • 희귀한 중국어 언어학 도구: 피니음 변환 및 문자의 부수/구조 분석.
  • 포괄적인 데이터 정제: 정규화 및 민감하거나 중복된 정보를 제거하는 통합 기능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트