stanfordnlp/stanza
Stanford NLP Python library for tokenization, sentence segmentation, NER, and parsing of many human languages
What it solves
Stanza 提供一套完整且精准的自然语言处理(NLP)工具,支持超过 60 种人类语言,免除从头自行构建语言专属流水线的需求。它同时也弥合了 Python 用户与基于 Java 的 Stanford CoreNLP 软件之间的鸿沟。
How it works
Stanza 使用 PyTorch 实现神经流水线,可下载后在本机运行。它支持多种 NLP 任务,包括分词、词形还原、词性标注与依存句法分析。此外,它亦作为 Java Stanford CoreNLP 软件的 Python 包装器,让用户能够通过环境变量和客户端接口访问其功能。
Who it’s for
此库设计给进行语言学分析的研究人员和开发者,也适用于处理生物医学和临床文献等专业领域的用户。
Highlights
- Broad Language Support: 基于 Universal Dependencies 的 60 多种语言预训练模型。
- Specialized Domain Models: 为生物医学和临床英文文本提供专属模型包。
- Flexible Implementation: 同时提供原生 PyTorch 神经流水线与 Java CoreNLP 的封装。
- Customizable: 所有神经模块均可使用 CoNLL-U 或 BIOES 格式的自定义数据进行训练。