stephenhky/PyShortTextCategorization

Various Algorithms for Short Text Mining

解決的問題

短文本分類常因資訊不足與詞彙稀疏性而困難。本套件提供工具,在文本被分類演算法處理前,建立其中間表示。

作法說明

此函式庫實作多種文字表示技術,包括主題模型(LDA、LSI、Random Projections)與詞嵌入演算法。接著,將這些表示應用於使用多種分類器的監督或非監督學習任務,例如卷積神經網路(ConvNet)、C-LSTM、最大熵與餘弦距離分類。

適用對象

需要對短文本資料進行預處理、表示與分類的開發者與資料科學家。

主要特色

  • 支援預訓練詞嵌入與 gensim 主題模型。
  • scikit-learn 整合,用於監督學習。
  • 高階分類選項,包含 ConvNet 與 C-LSTM 神經網路。
  • 文字實用工具,如拼字修正與字元級 seq2seq 學習。
  • 詞移距離(Word Mover's distance, WMD)與軟 Jaccard 分數等短語差異度量。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案