juliasilge/tidytext

Text mining using tidy tools :sparkles::page_facing_up::sparkles:

何を解決するか

テキスト分析に tidy data の原則を適用することで、テキストマイニングを簡素化します。ユーザーが非構造化テキストを構造化された「1トークン1行」の形式に変換できるようにし、専門的なテキストマイニングソフトウェアではなく、標準的なデータ操作ツールを使用して分析しやすくなります。

動作方法

このパッケージは、テキストデータフレームを tidy 形式に変換する関数を提供します。unnest_tokens() という主要な関数は、テキストを個々のトークン(単語、n-gram、文など)に分解します。tidy化されたデータは、dplyr を用いたフィルタリングやカウント、tidyr を用いたリシェイピング、ggplot2 を用いた可視化など、一般的な R ツールで処理できます。また、ストップワードの削除や感情分析用のセンチメント辞書の統合もサポートしています。

対象ユーザー

R を使用してテキストマイニングを実行したいデータアナリストや研究者向けに設計されています。

特徴

  • Tidy Transformation: tidyverse とシームレスに統合できる「1トークン1行」形式にテキストを変換。
  • 柔軟なトークン化: 単語、文字、n-gram、文、行、段落ごとにトークン化をサポート。
  • 感情分析: Bing など、組み込みのセンチメント辞書にアクセスし、感情スコアを計算可能。
  • 相互運用性: 他のテキストマイニングパッケージの DocumentTermMatrix オブジェクトを tidy データフレームに変換する関数を含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト