stephenhky/PyShortTextCategorization

Various Algorithms for Short Text Mining

何を解決するか

短いテキストの分類は、情報が不足しており単語の疎性(sparse)が問題となるため、困難です。このパッケージは、分類アルゴリズムに処理される前のテキストの中間表現を作成するためのツールを提供します。

動作方法

このライブラリは、トピックモデリング(LDA、LSI、Random Projections)および単語埋め込み(word-embedding)アルゴリズムを含む、さまざまなテキスト表現技術を実装しています。その後、これらの表現を、ConvNet、C-LSTM、最大エントロピー、コサイン距離分類などのさまざまな分類器を用いた教師あり・教師なし学習タスクに適用します。

対象ユーザー

短い形式のテキストデータを扱う開発者やデータサイエンティストで、前処理、表現、分類のための包括的なツールキットが必要な方。

特徴

  • 事前学習済みの単語埋め込みと gensim トピックモデルのサポート。
  • 教師あり学習用に scikit-learn との統合。
  • ConvNet や C-LSTM ニューラルネットワークを含む高度な分類オプション。
  • スペル訂正や文字レベルの seq2seq 学習などのテキストユーティリティツール。
  • Word Mover's distance (WMD) やソフト Jaccard スコアなどのフレーズ差分メトリクス。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト