MaartenGr/BERTopic

Leveraging BERT and c-TF-IDF to create easily interpretable topics.

해결하는 문제

BERTopic은 문서 모음에서 해석 가능한 토픽을 추출하도록 설계되었습니다. 밀집 클러스터와 클래스 기반 TF-IDF (c-TF-IDF) 절차를 사용하여 토픽 설명이 의미를 유지하고 중요한 단어를 보존하도록 함으로써 기존 토픽 모델링의 문제를 해결합니다.

작동 방식

이 프로젝트는 여러 단계로 구성된 모듈형 파이프라인을 사용합니다:

  1. Embedding: sentence-transformers와 같은 모델을 사용하여 문서를 벡터로 변환합니다.
  2. Dimensionality Reduction: 고차원 임베딩을 축소합니다 (일반적으로 UMAP 사용).
  3. Clustering: 축소된 임베딩을 토픽으로 그룹화합니다 (일반적으로 HDBSCAN 사용).
  4. Tokenization: 가중치 부여를 준비하기 위해 토픽을 토큰화합니다.
  5. Weighting: c-TF-IDF 절차를 사용하여 토큰에 가중치를 부여합니다.
  6. Representation: 가중치가 부여된 토큰을 사용하여 토픽을 표현하며, LLM(GPT-4 등) 또는 기타 표현 모델을 사용하여 이를 더욱 정교화할 수 있는 옵션이 있습니다.

대상 사용자

잠재적인 테마, 트렌드 및 패턴을 발견하기 위해 대량의 텍스트 또는 멀티모달 데이터를 분석해야 하는 데이터 과학자 및 연구자를 대상으로 합니다.

주요 특징

  • 높은 모듈성: 파이프라인의 모든 단계(embedding, reduction, clustering 등)를 교체하거나 제거할 수 있습니다.
  • 다양한 모델링: 가이드형, 지도 학습, 준지도 학습, 제로샷, 계층적 및 동적 토픽 모델링을 지원합니다.
  • LLM 통합: LLM을 사용하여 추출된 토픽에 대한 고품질 레이블과 요약을 생성할 수 있습니다.
  • 멀티모달 지원: 텍스트뿐만 아니라 이미지에 대해서도 토픽 모델링을 수행할 수 있습니다.
  • 풍부한 시각화: 토픽 계층 구조, 문서 분포 및 시간에 따른 토픽을 시각화하기 위한 내장 도구가 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트