MaartenGr/BERTopic
Leveraging BERT and c-TF-IDF to create easily interpretable topics.
解決的問題
BERTopic 旨在從文件集合中提取具解釋性的主題。它透過使用密集集群和基於類別的 TF-IDF (c-TF-IDF) 程序,確保主題描述保持具備意義並保留重要詞彙,從而解決了傳統主題建模的問題。
工作原理
該專案使用由多個步驟組成的模組化流水線:
- Embedding: 使用
sentence-transformers等模型將文件轉換為向量。 - Dimensionality Reduction: 降低高維嵌入的維度(通常使用
UMAP)。 - Clustering: 將降低維度的嵌入分組到主題中(通常使用
HDBSCAN)。 - Tokenization: 對主題進行分詞以準備加權。
- Weighting: 使用 c-TF-IDF 程序對標記進行加權。
- Representation: 使用加權標記來表示主題,並提供使用 LLM(如
GPT-4)或其他表示模型進一步精煉這些主題的選項。
適用對象
適用於需要分析大量文本或多模態數據以發現潛在主題、趨勢和模式的數據科學家和研究人員。
亮點
- 高度模組化: 流水線的每一步(嵌入、降維、集群等)都可以更換或移除。
- 多功能建模: 支援引導式、監督式、半監督式、零樣本、階層式和動態主題建模。
- LLM 整合: 可以使用 LLM 為提取的主題生成高品質的標籤和摘要。
- 多模態支援: 能夠對圖像以及文本執行主題建模。
- 豐富的可視化: 包含用於可視化主題階層結構、文件分佈和隨時間變化的主題的內建工具。
相關
- 專案
- 專案
- 專案
- 專案
- 專案