urchade/GLiNER
Generalist and Lightweight Model for Named Entity Recognition (Extract any entity types from texts)
해결하는 문제
GLiNER는 기존 Named Entity Recognition (NER) 모델의 한계를 극복하기 위해 설계되었습니다. 기존 모델은 일반적으로 새로운 엔티티 유형을 처리하기 위해 방대한 레이블 데이터와 태스크 전용 학습이 필요합니다. GLiNER는 새로운 학습 데이터 없이도 어떤 엔티티 유형이라도 제로샷 방식으로 추출할 수 있는 가벼우면서도 일반적인 프레임워크를 제공합니다.
작동 방식
GLiNER는 트랜스포머 기반 아키텍처를 사용하여 토큰 분류를 수행합니다. 다음과 같은 전문화된 아키텍처를 제공합니다:
- Uni-encoder: 강력한 제로샷 기능을 갖춘 원본 아키텍처입니다.
- Bi-encoder: 레이블 임베딩을 사전에 계산함으로써 수백 또는 수천 개의 엔티티 유형으로 확장 가능합니다.
- RelEx: 엔티티와 그 사이의 관계를 동시에 추출하는 통합 아키텍처입니다.
- GLiNER Decoder: 최대한의 유연성을 위해 엔티티 유형을 생성하는 하이브리드 아키텍처입니다.
- StreamingSpan: 증분 NER 및 지속적인 예측 업데이트를 위한 인과 스팬 모델입니다.
성능 최적화를 위해 torch.compile, FP16 및 INT8 양자화, ONNX 내보내기를 지원하며, CPU 및 소비자용 하드웨어에서 배포가 가능합니다.
대상 사용자
이 도구는 PII 탐지, 지식 그래프 구축, 다국어 환경에서의 도메인 특화 NER(예: 법적 또는 생물의학 분야)와 같은 정보 추출 작업을 수행하는 개발자 및 데이터 과학자에게 적합합니다.
주요 특징
- 제로샷 인식: 레이블 데이터 없이도 어떤 엔티티 유형이라도 추출 가능합니다.
- 고도의 확장성: Bi-encoder 아키텍처는 성능 저하 없이 수백만 개의 레이블을 지원합니다.
- 통합 추출: 한 번의 처리로 엔티티와 관계를 동시에 추출합니다.
- 프로덕션 준비 완료: 동적 배치 처리와 수평 확장 기능을 갖춘 Ray Serve 기반의 서빙 계층을 포함합니다.
- 하드웨어 효율성: 양자화 및 컴파일을 통해 CPU 및 소비자용 하드웨어에 최적화되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트