MaartenGr/BERTopic
Leveraging BERT and c-TF-IDF to create easily interpretable topics.
해결하는 문제
BERTopic은 문서 모음에서 해석 가능한 토픽을 추출하도록 설계되었습니다. 밀집 클러스터와 클래스 기반 TF-IDF (c-TF-IDF) 절차를 사용하여 토픽 설명이 의미를 유지하고 중요한 단어를 보존하도록 함으로써 기존 토픽 모델링의 문제를 해결합니다.
작동 방식
이 프로젝트는 여러 단계로 구성된 모듈형 파이프라인을 사용합니다:
- Embedding:
sentence-transformers와 같은 모델을 사용하여 문서를 벡터로 변환합니다. - Dimensionality Reduction: 고차원 임베딩을 축소합니다 (일반적으로
UMAP사용). - Clustering: 축소된 임베딩을 토픽으로 그룹화합니다 (일반적으로
HDBSCAN사용). - Tokenization: 가중치 부여를 준비하기 위해 토픽을 토큰화합니다.
- Weighting: c-TF-IDF 절차를 사용하여 토큰에 가중치를 부여합니다.
- Representation: 가중치가 부여된 토큰을 사용하여 토픽을 표현하며, LLM(
GPT-4등) 또는 기타 표현 모델을 사용하여 이를 더욱 정교화할 수 있는 옵션이 있습니다.
대상 사용자
잠재적인 테마, 트렌드 및 패턴을 발견하기 위해 대량의 텍스트 또는 멀티모달 데이터를 분석해야 하는 데이터 과학자 및 연구자를 대상으로 합니다.
주요 특징
- 높은 모듈성: 파이프라인의 모든 단계(embedding, reduction, clustering 등)를 교체하거나 제거할 수 있습니다.
- 다양한 모델링: 가이드형, 지도 학습, 준지도 학습, 제로샷, 계층적 및 동적 토픽 모델링을 지원합니다.
- LLM 통합: LLM을 사용하여 추출된 토픽에 대한 고품질 레이블과 요약을 생성할 수 있습니다.
- 멀티모달 지원: 텍스트뿐만 아니라 이미지에 대해서도 토픽 모델링을 수행할 수 있습니다.
- 풍부한 시각화: 토픽 계층 구조, 문서 분포 및 시간에 따른 토픽을 시각화하기 위한 내장 도구가 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트