juliasilge/tidytext

Text mining using tidy tools :sparkles::page_facing_up::sparkles:

해결하는 문제

텍스트 분석에 tidied data 원칙을 적용하여 텍스트 마이닝을 간소화합니다. 비구조화된 텍스트를 구조화된 '1 토큰당 1 행' 형식으로 변환할 수 있게 해주며, 전용 텍스트 마이닝 소프트웨어 대신 일반적인 데이터 조작 도구를 사용해 분석하는 것을 더 쉽게 만듭니다.

작동 방식

이 패키지는 텍스트 데이터프레임을 tidied 형식으로 변환하는 함수를 제공합니다. 주요 함수인 unnest_tokens()는 텍스트를 개별 토큰(예: 단어, n-gram, 문장 등)으로 분해합니다. tidied된 데이터는 dplyr를 사용한 필터링 및 카운팅, tidyr를 사용한 재구성, ggplot2를 사용한 시각화와 같은 일반적인 R 도구로 처리할 수 있습니다. 또한 정지어 제거 및 감성 사전 통합 기능을 통해 감성 분석도 지원합니다.

대상 사용자

R을 사용하여 일관된 tidied 워크플로우로 텍스트 마이닝을 수행하고자 하는 데이터 분석가 및 연구자에게 적합합니다.

주요 기능

  • Tidy 변환: tidyverse와 원활하게 통합되는 1 토큰당 1 행 형식으로 텍스트를 변환.
  • 유연한 토큰화: 단어, 문자, n-gram, 문장, 줄, 단락 단위로 토큰화 지원.
  • 감성 분석: Bing 등 내장된 감성 사전에 접근하여 감성 점수 계산 가능.
  • 상호 운용성: 다른 텍스트 마이닝 패키지의 DocumentTermMatrix 객체를 tidied 데이터프레임으로 변환하는 함수 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트