kermitt2/delft
a Deep Learning Framework for Text https://delft.readthedocs.io/
해결하는 문제
DeLFT는 시퀀스 레이블링(예: 명명된 엔티티 태깅)과 텍스트 분류를 전문으로 하는 딥러닝 프레임워크입니다. 많은 NLP 도구가 단순한 텍스트만 처리할 수 있는 한계를 극복하기 위해, PDF나 HTML 파일과 같은 구조화된 문서 내의 위치, 폰트 스타일, 레이아웃 정보와 연결된 "리치 텍스트"를 네이티브로 지원합니다.
작동 방식
Keras와 TensorFlow를 기반으로 구축되었으며, RNN과 Transformers를 포함한 다양한 최신 딥러닝 아키텍처를 구현합니다. HuggingFace Transformers를 Keras 레이어로 통합하고, 메모리에 맞지 않는 대규모 데이터셋을 처리하기 위해 동적 데이터 생성기를 사용합니다. 프로덕션 환경 최적화를 위해 단어 임베딩을 제거함으로써 RNN 모델 크기를 크게 줄여, 모델 크기를 종종 2MB 미만으로 축소합니다.
대상 사용자
복잡한 구조화된 문서에서 고성능 시퀀스 레이블링 또는 텍스트 분류를 수행해야 하는 개발자 및 연구자, 그리고 NLP 모델에 대한 재현 가능한 벤치마킹 환경이 필요한 사용자에게 적합합니다.
주요 특징
- 리치 텍스트 지원: 구조화된 문서에서 얻은 레이아웃 및 기호적 문맥 정보를 가진 토큰을 처리합니다.
- 모델 압축: RNN 모델 크기를 크게 줄여(예: 230MB → 1.8MB) 배포를 용이하게 합니다.
- 프로덕션 준비 완료: LMDB를 통해 사전 학습된 임베딩을 효율적으로 로드하여 성능과 안정성에 최적화되어 있습니다.
- 포괄적인 평가: 표준 메트릭과 n-폴드 교차검증을 위한 내장된 평가 프레임워크를 제공합니다.
- HuggingFace 통합: Transformer 기반 모델을 Keras 레이어로 시ーム리스하게 통합할 수 있습니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch