jdkato/prose
:book: A Golang library for text processing, including tokenization, part-of-speech tagging, and named-entity extraction.
해결하는 문제
Go 프로그래밍 언어를 위한 포괄적인 자연어 처리(NLP) 도구 세트를 제공하여, 개발자가 외부 서비스나 C 기반 의존성(cgo)에 의존하지 않고 영어 텍스트를 분석할 수 있도록 합니다.
작동 방식
이 라이브러리는 NLP 작업 파이프라인을 구현합니다. 문장 분리에는 Punkt 알고리즘을, 품사 태깅에는 Penn Treebank 태그 세트를 사용합니다. 태깅 및 개체명 인식(NER)을 위한 사전 학습된 모델이 포함되어 있으며, 이는 프로세스당 한 번 메모리에 로드됩니다. 바이너리 크기를 작게 유지하기 위해 이러한 모델은 별도의 패키지로 분리되어 있어 Go 링커가 사용되지 않는 구성 요소를 제외할 수 있습니다.
대상
독립적인 순수 Go 환경에서 토큰화, 엔티티 추출, 가독성 점수 계산과 같은 기본적인 NLP 작업을 수행해야 하는 Go 개발자.
주요 특징
- Pure Go: cgo 또는 외부 API 호출이 필요하지 않습니다.
- 바이트 단위 오프셋: 모든 토큰, 문장 및 엔티티는 원본 소스 텍스트에 대해 정확한 바이트 오프셋을 유지합니다.
- 모듈형 설계: 태거 및 엔티티 인식기와 같은 구성 요소를 독립적으로 임포트하여 바이너리 오버헤드를 줄일 수 있습니다.
- 가독성 지표: Flesch–Kincaid, Gunning fog, SMOG 및 Coleman–Liau 점수를 기본적으로 지원합니다.
- 동시성 안전성: 모든 핵심 분석 도구는 동시 사용에 안전합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트