MaartenGr/BERTopic

Leveraging BERT and c-TF-IDF to create easily interpretable topics.

解决的问题

BERTopic 旨在从文档集合中提取可解释的主题。它通过使用密集聚类和基于类的 TF-IDF (c-TF-IDF) 程序,确保主题描述保持有意义并保留重要词汇,从而解决了传统主题建模的问题。

工作原理

该项目使用由多个步骤组成的模块化流水线:

  1. Embedding: 使用 sentence-transformers 等模型将文档转换为向量。
  2. Dimensionality Reduction: 降低高维嵌入的维度(通常使用 UMAP)。
  3. Clustering: 将降低维度的嵌入分组到主题中(通常使用 HDBSCAN)。
  4. Tokenization: 对主题进行分词以准备加权。
  5. Weighting: 使用 c-TF-IDF 程序对标记进行加权。
  6. Representation: 使用加权标记来表示主题,并提供使用 LLM(如 GPT-4)或其他表示模型进一步精炼这些主题的选项。

适用对象

适用于需要分析大量文本或多模态数据以发现潜在主题、趋势和模式的数据科学家和研究人员。

亮点

  • 高度模块化: 流水线的每一步(嵌入、降维、聚类等)都可以更换或移除。
  • 多功能建模: 支持引导式、监督式、半监督式、零样本、层次化和动态主题建模。
  • LLM 集成: 可以使用 LLM 为提取的主题生成高质量的标签和摘要。
  • 多模态支持: 能够对图像以及文本执行主题建模。
  • 丰富的可视化: 包含用于可视化主题层次结构、文档分布和随时间变化的主题的内置工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目