stanfordnlp/CoreNLP

CoreNLP: A Java suite of core NLP tools for tokenization, sentence segmentation, NER, parsing, coreference, sentiment analysis, etc.

解決する課題

Stanford CoreNLP は、人間の生の言語テキストを構造化データに変換する自然言語分析ツールセットです。テキストから言語的特徴の抽出を自動化することで、より高度なテキスト理解アプリケーション向けの基礎的な構成要素を提供します。

仕組み

ルールベースのシステム、確率論的機械学習、ディープラーニングコンポーネントを組み合わせて使用する、Java で記述された統合フレームワークです。システムは、テキストに対して一連の言語分析ツール(annotators)を実行し、さまざまな言語プロパティを抽出するように設定できます。

対象者

学術界、産業界、政府の研究者によって、英語、アラビア語、中国語、フランス語、ドイツ語、ハンガリー語、イタリア語、スペイン語など、複数の言語にわたる自然言語処理タスクに広く使用されています。

ハイライト

  • 包括的な分析: 単語の基本形、品詞、固有表現(企業、人物など)、統語構造(句または依存関係)を抽出します。
  • 正規化: 日付、時刻、数値を解釈して正規化します。
  • 共参照解析: どの名詞句が同じエンティティを指しているかを特定します。
  • 多言語サポート: 世界の主要な複数の言語に対して、さまざまなレベルのサポートを提供します。
  • 簡単な統合: わずか2行のコードで完全な分析ツールスイートを実行できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト