megagonlabs/ginza

A Japanese NLP Library using spaCy as framework based on Universal Dependencies

解決的問題

GiNZA 是一個開源的日語自然語言處理(NLP)庫,旨在為日語提供高精度的語言分析,具體遵循 Universal Dependencies (UD) 框架。

運作原理

它構建在 spaCy 框架之上,並整合了多個用於日語文本處理的專用工具:

  • 分詞和詞性標註:使用 SudachiPy 進行高精度的分詞和詞性標註。
  • 模型:提供多種模型選項,包括標準速度優先模型(ja_ginza)和基於 Transformer 的高精度模型(ja_ginza_electra),後者使用 Hugging Face Transformers 訓練並在 mC4 數據集上進行預訓練。
  • 句法分析:句法分析模型在 UD Japanese BCCWJ 數據集上訓練。
  • 命名實體識別 (NER):NER 模型在 GSK2014-A (2019) BCCWJ 版本上訓練,支持 Sekine 擴展命名實體層次結構和擴展 OntoNotes5。

適用人群

需要在 Python 環境中使用專業級日語 NLP 功能(如句法分析、分詞和命名實體識別)的開發人員和研究人員。

亮點

  • Universal Dependencies:基於 UD 框架,實現一致的句法標註。
  • 靈活的模型:可在快速的標準模型和高性能的 Transformer 模型之間進行選擇。
  • 命令列工具:包含用於完整句法分析(支持 JSON 和 CaboCha 風格輸出)的 ginza 和用於類似 MeCab 分詞的 ginzame
  • GPU 加速:支持 CUDA 以加速基於 Transformer 的模型,並支持 thinc-apple-ops 以加速 Apple Silicon (M1/M2)。
  • 廣泛的整合:與 spaCy 生態系統無縫整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案