explosion/spaCy
💫 Industrial-strength Natural Language Processing (NLP) in Python
What it solves
spaCy 提供了一个生产就绪的库,用于高级自然语言处理 (NLP),使开发者能够构建可以高速且准确地分析和处理人类语言的实际产品。
How it works
它结合了 Python 和 Cython 以提供最先进的速度。该库为 70 多种语言提供预训练流水线,结合了神经网络模型和 Transformers (如 BERT) 用于各种语言学任务。它允许用户将预训练模型作为 Python 包进行加载,或使用生产就绪的训练系统来训练自定义模型,并支持 PyTorch 和 TensorFlow 等框架。
Who it's for
它专为需要将工业级 NLP 能力集成到软件产品中的开发者和研究人员设计,范围从基础的文本处理到复杂的多任务学习。
Highlights
- Broad Language Support: 70 多种语言的分词和训练。
- Comprehensive NLP Toolset: 内置组件用于命名实体识别 (NER)、命名实体识别 (NER)、词性标注、依存句法分析、文本分类和词形还原。
- Transformer Integration: 支持使用预训练 Transformers (如 BERT) 的多任务学习。
- Production-Ready: 具备强大的训练系统、易于的模型打包和部署工作流管理。
- Extensible: 允许自定义组件、属性和集成各种 ML 框架。