megagonlabs/ginza

A Japanese NLP Library using spaCy as framework based on Universal Dependencies

解决的问题

GiNZA 是一个开源的日语自然语言处理(NLP)库,旨在为日语提供高精度的语言分析,具体遵循 Universal Dependencies (UD) 框架。

工作原理

它构建在 spaCy 框架之上,并集成了多个用于日语文本处理的专用工具:

  • 分词和词性标注:使用 SudachiPy 进行高精度的分词和词性标注。
  • 模型:提供多种模型选项,包括标准速度优先模型(ja_ginza)和基于 Transformer 的高精度模型(ja_ginza_electra),后者使用 Hugging Face Transformers 训练并在 mC4 数据集上进行预训练。
  • 句法分析:句法分析模型在 UD Japanese BCCWJ 数据集上训练。
  • 命名实体识别 (NER):NER 模型在 GSK2014-A (2019) BCCWJ 版本上训练,支持 Sekine 扩展命名实体层次结构和扩展 OntoNotes5。

适用人群

需要在 Python 环境中使用专业级日语 NLP 功能(如句法分析、分词和命名实体识别)的开发人员和研究人员。

亮点

  • Universal Dependencies:基于 UD 框架,实现一致的句法标注。
  • 灵活的模型:可在快速的标准模型和高性能的 Transformer 模型之间进行选择。
  • 命令行工具:包含用于完整句法分析(支持 JSON 和 CaboCha 风格输出)的 ginza 和用于类似 MeCab 分词的 ginzame
  • GPU 加速:支持 CUDA 以加速基于 Transformer 的模型,并支持 thinc-apple-ops 以加速 Apple Silicon (M1/M2)。
  • 广泛的集成:与 spaCy 生态系统无缝集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目