MaartenGr/BERTopic

Leveraging BERT and c-TF-IDF to create easily interpretable topics.

解決的問題

BERTopic 旨在從文件集合中提取具解釋性的主題。它透過使用密集集群和基於類別的 TF-IDF (c-TF-IDF) 程序,確保主題描述保持具備意義並保留重要詞彙,從而解決了傳統主題建模的問題。

工作原理

該專案使用由多個步驟組成的模組化流水線:

  1. Embedding: 使用 sentence-transformers 等模型將文件轉換為向量。
  2. Dimensionality Reduction: 降低高維嵌入的維度(通常使用 UMAP)。
  3. Clustering: 將降低維度的嵌入分組到主題中(通常使用 HDBSCAN)。
  4. Tokenization: 對主題進行分詞以準備加權。
  5. Weighting: 使用 c-TF-IDF 程序對標記進行加權。
  6. Representation: 使用加權標記來表示主題,並提供使用 LLM(如 GPT-4)或其他表示模型進一步精煉這些主題的選項。

適用對象

適用於需要分析大量文本或多模態數據以發現潛在主題、趨勢和模式的數據科學家和研究人員。

亮點

  • 高度模組化: 流水線的每一步(嵌入、降維、集群等)都可以更換或移除。
  • 多功能建模: 支援引導式、監督式、半監督式、零樣本、階層式和動態主題建模。
  • LLM 整合: 可以使用 LLM 為提取的主題生成高品質的標籤和摘要。
  • 多模態支援: 能夠對圖像以及文本執行主題建模。
  • 豐富的可視化: 包含用於可視化主題階層結構、文件分佈和隨時間變化的主題的內建工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案