stanfordnlp/stanza
Stanford NLP Python library for tokenization, sentence segmentation, NER, and parsing of many human languages
What it solves
Stanza 提供一套完整且精確的自然語言處理(NLP)工具,支援超過 60 種人類語言,免除從頭自行建構語言專屬管線的需求。它同時也彌合了 Python 使用者與基於 Java 的 Stanford CoreNLP 軟體之間的鴻溝。
How it works
Stanza 使用 PyTorch 實作神經管線,可下載後在本機執行。它支援多種 NLP 任務,包括斷詞、詞形還原、詞性標註與依存句法分析。此外,它亦作為 Java Stanford CoreNLP 軟體的 Python 包裝器,讓使用者能透過環境變數與客戶端介面存取其功能。
Who it’s for
此套件設計給執行語言學分析的研究人員與開發者,同時也適用於處理生醫與臨床文獻等專業領域的使用者。
Highlights
- Broad Language Support: 基於 Universal Dependencies 的 60 多種語言預訓練模型。
- Specialized Domain Models: 為生醫與臨床英文文本提供專屬模型套件。
- Flexible Implementation: 同時提供原生 PyTorch 神經管線與 Java CoreNLP 的封裝。
- Customizable: 所有神經模組皆可使用 CoNLL-U 或 BIOES 格式的自訂資料進行訓練。