MaartenGr/BERTopic

Leveraging BERT and c-TF-IDF to create easily interpretable topics.

解決する課題

BERTopicは、ドキュメントの集合から解釈可能なトピックを抽出するために設計されています。高密度なクラスターとクラスベースTF-IDF (c-TF-IDF) 手法を使用することで、トピックの記述が意味を持ち続け、重要な単語が保持されるようにし、従来のトピックモデリングの問題を解決します。

仕組み

このプロジェクトは、以下のステップからなるモジュール式のパイプラインを使用しています:

  1. Embedding: sentence-transformersなどのモデルを使用して、ドキュメントをベクトルに変換します。
  2. Dimensionality Reduction: 高次元の埋め込みを削減します(通常はUMAPを使用)。
  3. Clustering: 削減された埋め込みをトピックにグループ化します(通常はHDBSCANを使用)。
  4. Tokenization: 重み付けの準備として、トピックをトークン化します。
  5. Weighting: c-TF-IDF手順を使用してトークンの重みを決定します。
  6. Representation: 重み付けされたトークンを使用してトピックを表現します。LLM(GPT-4など)やその他の表現モデルを使用して、さらに洗練させるオプションもあります。

対象者

大量のテキストまたはマルチモーダルデータを分析して、潜在的なテーマ、傾向、パターンを発見する必要があるデータサイエンティストや研究者向けです。

ハイライト

  • 高度なモジュール性: パイプラインの各ステップ(embedding、reduction、clusteringなど)を入れ替えたり削除したりできます。
  • 多才なモデリング: ガイド付き、教師あり、半教師あり、ゼロショット、階層的、および動的なトピックモデリングをサポートしています。
  • LLM統合: LLMを使用して、抽出されたトピックに対して高品質なラベルや要約を生成できます。
  • マルチモーダル対応: テキストだけでなく、画像に対してもトピックモデリングを実行できます。
  • 豊富な可視化: トピックの階層、ドキュメントの分布、および時間の経過に伴うトピックを可視化するための組み込みツールが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト