stanfordnlp/stanza

Stanford NLP Python library for tokenization, sentence segmentation, NER, and parsing of many human languages

What it solves

Stanza は、60 以上の人間言語に対応した包括的で高精度な自然言語処理(NLP)ツールを提供し、言語ごとにパイプラインを一から構築する必要をなくします。また、Python ユーザーと Java ベースの Stanford CoreNLP ソフトウェアとの間のギャップを埋めます。

How it works

Stanza は PyTorch を用いたニューラルパイプラインを実装しており、ダウンロードしてローカルで実行できます。トークン化、レマタイズ、品詞タグ付け、依存構造解析など、さまざまな NLP タスクをサポートします。さらに、Java の Stanford CoreNLP ソフトウェアの Python ラッパーとして機能し、環境変数やクライアントインターフェースを通じてその機能にアクセスできます。

Who it’s for

言語解析を行う研究者や開発者、またバイオメディカルや臨床文献などの専門領域で作業する方々を対象としています。

Highlights

  • Broad Language Support: Universal Dependencies に基づく 60 以上の言語向け事前学習モデル。
  • Specialized Domain Models: バイオメディカルおよび臨床英語テキスト向けの専用モデルパッケージ。
  • Flexible Implementation: ネイティブな PyTorch ニューラルパイプラインと Java CoreNLP のラッパーの両方を提供。
  • Customizable: すべてのニューラルモジュールは CoNLL-U または BIOES 形式のカスタムデータで再学習可能。