juliasilge/tidytext

Text mining using tidy tools :sparkles::page_facing_up::sparkles:

解決的問題

透過應用 tidy data 原則於文本分析,簡化文本挖掘。允許使用者將非結構化文字轉換為結構化的「每列一個詞元」格式,使分析更容易使用標準資料操作工具,而非專用的文本挖掘軟體。

如何運作

此套件提供函數將文字資料框轉換為 tidied 格式。關鍵函數 unnest_tokens() 將文字分解為個別詞元(例如單字、n-gram 或句子)。整理後的資料可使用常見的 R 工具處理,例如使用 dplyr 進行篩選與計數、tidyr 進行重塑、ggplot2 進行視覺化。也包含移除停用詞與整合情感詞典以進行情感分析的工具。

適用對象

專為使用 R 並希望以一致、tidy 工作流程進行文本挖掘的資料分析師與研究人員設計。

主要特色

  • Tidy 轉換:將文字轉換為每行一個詞元的格式,可與 tidyverse 無縫整合。
  • 彈性詞元化:支援按單字、字元、n-gram、句子、行與段落進行詞元化。
  • 情感分析:提供內建情感詞典(例如 Bing)的存取,以計算情感分數。
  • 相容性:包含將其他文本挖掘套件的 DocumentTermMatrix 物件轉換為 tidied 資料框的函數。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案