MaartenGr/BERTopic
Leveraging BERT and c-TF-IDF to create easily interpretable topics.
解决的问题
BERTopic 旨在从文档集合中提取可解释的主题。它通过使用密集聚类和基于类的 TF-IDF (c-TF-IDF) 程序,确保主题描述保持有意义并保留重要词汇,从而解决了传统主题建模的问题。
工作原理
该项目使用由多个步骤组成的模块化流水线:
- Embedding: 使用
sentence-transformers等模型将文档转换为向量。 - Dimensionality Reduction: 降低高维嵌入的维度(通常使用
UMAP)。 - Clustering: 将降低维度的嵌入分组到主题中(通常使用
HDBSCAN)。 - Tokenization: 对主题进行分词以准备加权。
- Weighting: 使用 c-TF-IDF 程序对标记进行加权。
- Representation: 使用加权标记来表示主题,并提供使用 LLM(如
GPT-4)或其他表示模型进一步精炼这些主题的选项。
适用对象
适用于需要分析大量文本或多模态数据以发现潜在主题、趋势和模式的数据科学家和研究人员。
亮点
- 高度模块化: 流水线的每一步(嵌入、降维、聚类等)都可以更换或移除。
- 多功能建模: 支持引导式、监督式、半监督式、零样本、层次化和动态主题建模。
- LLM 集成: 可以使用 LLM 为提取的主题生成高质量的标签和摘要。
- 多模态支持: 能够对图像以及文本执行主题建模。
- 丰富的可视化: 包含用于可视化主题层次结构、文档分布和随时间变化的主题的内置工具。
相关
- 项目
- 项目
- 项目
- 项目
- 项目