quanteda/quanteda

An R package for the Quantitative Analysis of Textual Data

何を解決するか

テキストデータの定量的分析の包括的なツールキットを提供し、R環境内でテキストを効率的に管理・分析できるようにします。

動作方法

このプロジェクトは、C++およびFortranのソースコードを活用して高性能な計算を実現するRパッケージとして実装されています。Intel oneAPI Threading Building Blocks (TBB)ライブラリを使用して並列計算を可能にし、大規模なテキストデータセットの処理を高速化します。コアパッケージは自然言語処理(NLP)およびテキストデータ管理を担当し、quanteda.textmodelsquanteda.textstatsquanteda.textplotsなどのモジュール型パッケージ群が、モデリング、統計、可視化に特化した関数を提供します。

対象ユーザー

Rを用いて定量的テキスト分析および自然言語処理を行う研究者やデータサイエンティスト。

特徴

  • UnicodeおよびICU準拠のルールによる高パフォーマンスなトークン化(多言語対応)。
  • TBBを介した並列計算機能により処理速度を向上。
  • コアNLP機能と統計、モデル、プロットを分離したモジュールアーキテクチャ。
  • quanteda.tidy拡張によるtidyverseとの統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト