bab2min/kiwipiepy

Python API for Kiwi

해결하는 문제

Kiwipiepy는 한국어 텍스트를 가장 작은 의미 단위(형태소)로 분해하고, 품사(POS) 태그를 부여하는 한국어 형태소 분석기입니다. 한국어의 복잡성을 다루며, 오타, 방언, 전문 용어의 정확한 분석을 위해 사용자 정의 사전이 필요한 문제를 해결합니다.

작동 방식

Kiwi 형태소 분석기의 Python API를 제공합니다. 시스템은 텍스트를 토큰화하고, 문장을 분할하며, 형태소로부터 문장을 재구성할 수 있습니다. Stopwords 클래스를 통한 필터링, 사용자 정의 단어 또는 정규 표현식 규칙을 추가하여 변형을 처리할 수 있으며, 특정 잘못된 분석을 수정하는 사전 분석 보정 도구도 제공합니다.

대상 사용자

한국어 자연어 처리(NLP) 작업을 수행하는 개발자 및 데이터 과학자로서, 신뢰성 있고 사용자 정의가 가능한 토큰화 및 품사 태깅 도구가 필요한 분들입니다.

주요 기능

  • 고도화된 오타 보정: 기본 오타, 연속(연결) 오타, 길이 오류 등 여러 수준의 오타 보정을 지원합니다.
  • 사용자 정의 사전: 공백을 포함한 사용자 단어 추가가 가능하며, 추가된 동사와 형용사의 어형 변화를 자동으로 처리합니다.
  • 방언 지원: 제주, 경상, 전라 등 다양한 한국 방언과 고대 한국어에 대한 기본 분석 기능을 포함합니다.
  • 유연한 토큰화: '사이시옷'(간접적인 's') 처리, 종성 정규화, 규칙 기반 또는 경량 문자 모델 기반 방식을 사용하여 어휘 외 단어(OOV)를 탐지할 수 있는 옵션을 제공합니다.
  • 다국어 지원: 외래어, 이모지, Unicode 스크립트에 대한 처리를 강화했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트