stephenhky/PyShortTextCategorization

Various Algorithms for Short Text Mining

解决的问题

短文本分类往往因信息不足和词汇稀疏性而困难重重。该包提供工具,在文本被分类算法处理之前,创建其中间表示形式。

工作原理

该库实现了多种文本表示技术,包括主题建模(LDA、LSI、随机投影)和词嵌入算法。随后,将这些表示应用于各种分类器的监督或无监督学习任务中,例如卷积神经网络(ConvNet)、C-LSTM、最大熵和余弦距离分类。

适用人群

需要对短文本数据进行预处理、表示和分类的开发者和数据科学家。

主要亮点

  • 支持预训练词嵌入和 gensim 主题模型。
  • scikit-learn 集成,用于监督学习。
  • 高级分类选项,包括 ConvNet 和 C-LSTM 神经网络。
  • 文本实用工具,如拼写纠正和字符级 seq2seq 学习。
  • 词移距离(Word Mover's distance, WMD)和软 Jaccard 分数等短语差异度量。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目