stanfordnlp/stanza

Stanford NLP Python library for tokenization, sentence segmentation, NER, and parsing of many human languages

What it solves

Stanza 提供一套完整且精確的自然語言處理(NLP)工具,支援超過 60 種人類語言,免除從頭自行建構語言專屬管線的需求。它同時也彌合了 Python 使用者與基於 Java 的 Stanford CoreNLP 軟體之間的鴻溝。

How it works

Stanza 使用 PyTorch 實作神經管線,可下載後在本機執行。它支援多種 NLP 任務,包括斷詞、詞形還原、詞性標註與依存句法分析。此外,它亦作為 Java Stanford CoreNLP 軟體的 Python 包裝器,讓使用者能透過環境變數與客戶端介面存取其功能。

Who it’s for

此套件設計給執行語言學分析的研究人員與開發者,同時也適用於處理生醫與臨床文獻等專業領域的使用者。

Highlights

  • Broad Language Support: 基於 Universal Dependencies 的 60 多種語言預訓練模型。
  • Specialized Domain Models: 為生醫與臨床英文文本提供專屬模型套件。
  • Flexible Implementation: 同時提供原生 PyTorch 神經管線與 Java CoreNLP 的封裝。
  • Customizable: 所有神經模組皆可使用 CoNLL-U 或 BIOES 格式的自訂資料進行訓練。