juliasilge/tidytext
Text mining using tidy tools :sparkles::page_facing_up::sparkles:
解决的问题
通过将 tidy data 原则应用于文本分析,简化了文本挖掘。它允许用户将非结构化文本转换为结构化的「每行一个词元」格式,从而更容易使用标准数据操作工具进行分析,而无需依赖专门的文本挖掘软件。
工作原理
该包提供函数将文本数据框转换为 tidy 格式。一个关键函数 unnest_tokens() 将文本分解为单个词元(如单词、n-gram 或句子)。数据被整理后,可以使用常见的 R 工具进行处理,例如使用 dplyr 进行过滤和计数,使用 tidyr 重塑数据,使用 ggplot2 进行可视化。它还包含用于移除停用词和集成情感词典以进行情感分析的工具。
适用人群
专为使用 R 并希望采用一致、tidy 工作流进行文本挖掘的数据分析师和研究人员设计。
主要亮点
- Tidy 转换:将文本转换为每行一个词元的格式,可无缝集成到 tidyverse 中。
- 灵活的词元化:支持按单词、字符、n-gram、句子、行和段落进行词元化。
- 情感分析:提供对情感词典(如 Bing)的内置访问,用于计算情感得分。
- 互操作性:包含将其他文本挖掘包的
DocumentTermMatrix对象转换为 tidy 数据框的函数。
相关
- 项目
- 项目
- 项目
- 项目
- 项目