stephenhky/PyShortTextCategorization
Various Algorithms for Short Text Mining
解決的問題
短文本分類常因資訊不足與詞彙稀疏性而困難。本套件提供工具,在文本被分類演算法處理前,建立其中間表示。
作法說明
此函式庫實作多種文字表示技術,包括主題模型(LDA、LSI、Random Projections)與詞嵌入演算法。接著,將這些表示應用於使用多種分類器的監督或非監督學習任務,例如卷積神經網路(ConvNet)、C-LSTM、最大熵與餘弦距離分類。
適用對象
需要對短文本資料進行預處理、表示與分類的開發者與資料科學家。
主要特色
- 支援預訓練詞嵌入與
gensim主題模型。 - 與
scikit-learn整合,用於監督學習。 - 高階分類選項,包含 ConvNet 與 C-LSTM 神經網路。
- 文字實用工具,如拼字修正與字元級 seq2seq 學習。
- 詞移距離(Word Mover's distance, WMD)與軟 Jaccard 分數等短語差異度量。
相關
- 專案
- 專案
- 專案
- 專案
- 專案