stanfordnlp/stanza
Stanford NLP Python library for tokenization, sentence segmentation, NER, and parsing of many human languages
What it solves
Stanza는 60개 이상의 인간 언어에 대한 포괄적이고 정확한 자연어 처리(NLP) 도구를 제공하여 언어별 파이프라인을 처음부터 구축할 필요성을 없앱니다. 또한 Python 사용자와 Java 기반 Stanford CoreNLP 소프트웨어 간의 격차를 메워줍니다.
How it works
Stanza는 PyTorch를 사용한 신경 파이프라인을 구현하며, 다운로드 후 로컬에서 실행할 수 있습니다. 토큰화, 형태소 분석, 품사 태깅, 의존 구문 분석 등 다양한 NLP 작업을 지원합니다. 또한 Java Stanford CoreNLP 소프트웨어의 Python 래퍼 역할을 하여 환경 변수와 클라이언트 인터페이스를 통해 기능에 접근할 수 있게 합니다.
Who it’s for
언어 분석을 수행하는 연구자와 개발자, 그리고 생물 의학 및 임상 문헌과 같은 전문 분야에서 작업하는 사람들을 위해 설계되었습니다.
Highlights
- Broad Language Support: Universal Dependencies 기반 60개 이상의 언어에 대한 사전 학습 모델.
- Specialized Domain Models: 생물 의학 및 임상 영어 텍스트를 위한 전용 모델 패키지.
- Flexible Implementation: 네이티브 PyTorch 신경 파이프라인과 Java CoreNLP 래퍼를 모두 제공.
- Customizable: 모든 신경 모듈은 CoNLL-U 또는 BIOES 형식의 사용자 정의 데이터로 학습 가능.