stephenhky/PyShortTextCategorization
Various Algorithms for Short Text Mining
해결하는 문제
짧은 텍스트는 정보가 부족하고 단어의 희소성 문제를 겪기 때문에 분류하기 어렵습니다. 이 패키지는 분류 알고리즘에 의해 처리되기 전에 텍스트의 중간 표현을 생성하는 도구를 제공합니다.
작동 방식
이 라이브러리는 LDA, LSI, Random Projections 등의 토픽 모델링과 단어 임베딩 알고리즘을 포함한 다양한 텍스트 표현 기법을 구현합니다. 그런 다음 이 표현들을 ConvNet, C-LSTM, 최대 엔트로피, 코사인 거리 분류 등 다양한 분류기로 사용하여 지도 또는 비지도 학습 작업에 적용합니다.
대상 사용자
짧은 텍스트 데이터를 다루는 개발자 및 데이터 과학자로서 전처리, 표현, 분류를 위한 포괄적인 툴킷이 필요한 분들.
주요 기능
- 사전 학습된 단어 임베딩 및
gensim토픽 모델 지원. - 지도 학습을 위한
scikit-learn통합. - ConvNet 및 C-LSTM 뉴럴 네트워크를 포함한 고급 분류 옵션.
- 철자 검사 및 문자 수준의 seq2seq 학습과 같은 텍스트 유틸리티 도구.
- Word Mover's distance (WMD) 및 소프트 Jaccard 스코어와 같은 표현 차이 메트릭스.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트