juliasilge/tidytext
Text mining using tidy tools :sparkles::page_facing_up::sparkles:
何を解決するか
テキスト分析に tidy data の原則を適用することで、テキストマイニングを簡素化します。ユーザーが非構造化テキストを構造化された「1トークン1行」の形式に変換できるようにし、専門的なテキストマイニングソフトウェアではなく、標準的なデータ操作ツールを使用して分析しやすくなります。
動作方法
このパッケージは、テキストデータフレームを tidy 形式に変換する関数を提供します。unnest_tokens() という主要な関数は、テキストを個々のトークン(単語、n-gram、文など)に分解します。tidy化されたデータは、dplyr を用いたフィルタリングやカウント、tidyr を用いたリシェイピング、ggplot2 を用いた可視化など、一般的な R ツールで処理できます。また、ストップワードの削除や感情分析用のセンチメント辞書の統合もサポートしています。
対象ユーザー
R を使用してテキストマイニングを実行したいデータアナリストや研究者向けに設計されています。
特徴
- Tidy Transformation: tidyverse とシームレスに統合できる「1トークン1行」形式にテキストを変換。
- 柔軟なトークン化: 単語、文字、n-gram、文、行、段落ごとにトークン化をサポート。
- 感情分析: Bing など、組み込みのセンチメント辞書にアクセスし、感情スコアを計算可能。
- 相互運用性: 他のテキストマイニングパッケージの
DocumentTermMatrixオブジェクトを tidy データフレームに変換する関数を含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト