megagonlabs/ginza
A Japanese NLP Library using spaCy as framework based on Universal Dependencies
解决的问题
GiNZA 是一个开源的日语自然语言处理(NLP)库,旨在为日语提供高精度的语言分析,具体遵循 Universal Dependencies (UD) 框架。
工作原理
它构建在 spaCy 框架之上,并集成了多个用于日语文本处理的专用工具:
- 分词和词性标注:使用 SudachiPy 进行高精度的分词和词性标注。
- 模型:提供多种模型选项,包括标准速度优先模型(
ja_ginza)和基于 Transformer 的高精度模型(ja_ginza_electra),后者使用 Hugging Face Transformers 训练并在 mC4 数据集上进行预训练。 - 句法分析:句法分析模型在 UD Japanese BCCWJ 数据集上训练。
- 命名实体识别 (NER):NER 模型在 GSK2014-A (2019) BCCWJ 版本上训练,支持 Sekine 扩展命名实体层次结构和扩展 OntoNotes5。
适用人群
需要在 Python 环境中使用专业级日语 NLP 功能(如句法分析、分词和命名实体识别)的开发人员和研究人员。
亮点
- Universal Dependencies:基于 UD 框架,实现一致的句法标注。
- 灵活的模型:可在快速的标准模型和高性能的 Transformer 模型之间进行选择。
- 命令行工具:包含用于完整句法分析(支持 JSON 和 CaboCha 风格输出)的
ginza和用于类似 MeCab 分词的ginzame。 - GPU 加速:支持 CUDA 以加速基于 Transformer 的模型,并支持
thinc-apple-ops以加速 Apple Silicon (M1/M2)。 - 广泛的集成:与 spaCy 生态系统无缝集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目