megagonlabs/ginza
A Japanese NLP Library using spaCy as framework based on Universal Dependencies
해결하는 문제
GiNZA는 Universal Dependencies(UD) 프레임워크를 따르는 일본어 자연어 처리(NLP)를 위한 오픈소스 라이브러리로, 일본어에 대한 높은 정확도의 언어 분석을 제공하는 것을 목표로 합니다.
작동 방식
spaCy 프레임워크 위에 구축되어 있으며, 일본어 텍스트 처리를 위한 몇 가지 전문 도구가 통합되어 있습니다:
- 토큰화 및 품사 태깅: 높은 정확도의 토큰화와 품사 태깅을 위해 SudachiPy를 사용합니다.
- 모델: 표준 속도 중심 모델(
ja_ginza)과 Hugging Face Transformers를 사용하여 mC4 데이터셋으로 사전 학습된 높은 정확도의 Transformer 기반 모델(ja_ginza_electra)을 포함한 여러 모델 옵션을 제공합니다. - 파싱: 파싱 모델은 UD Japanese BCCWJ 데이터셋으로 학습되었습니다.
- 명사 인식(NER): NER 모델은 GSK2014-A (2019) BCCWJ 버전으로 학습되었으며, Sekine의 확장 명사 계층과 확장 OntoNotes5를 모두 지원합니다.
대상 사용자
Python 환경 내에서 의존성 파싱, 토큰화, 명사 인식과 같은 전문 수준의 일본어 NLP 기능이 필요한 개발자와 연구자입니다.
주요 특징
- Universal Dependencies: 일관된 통사적 주석을 위한 UD 프레임워크를 기반으로 합니다.
- 유연한 모델: 빠른 표준 모델과 고성능 Transformer 모델 사이에서 선택할 수 있습니다.
- 명령줄 도구: 전체 파싱(JSON 및 CaboCha 스타일 출력 포함)을 위한
ginza와 MeCab 유사 토큰화를 위한ginzame이 포함되어 있습니다. - GPU 가속: Transformer 기반 모델 가속을 위한 CUDA와 Apple Silicon(M1/M2) 가속을 위한
thinc-apple-ops를 지원합니다. - 광범위한 통합: spaCy 생태계와 원활하게 통합됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트