megagonlabs/ginza
A Japanese NLP Library using spaCy as framework based on Universal Dependencies
解決的問題
GiNZA 是一個開源的日語自然語言處理(NLP)庫,旨在為日語提供高精度的語言分析,具體遵循 Universal Dependencies (UD) 框架。
運作原理
它構建在 spaCy 框架之上,並整合了多個用於日語文本處理的專用工具:
- 分詞和詞性標註:使用 SudachiPy 進行高精度的分詞和詞性標註。
- 模型:提供多種模型選項,包括標準速度優先模型(
ja_ginza)和基於 Transformer 的高精度模型(ja_ginza_electra),後者使用 Hugging Face Transformers 訓練並在 mC4 數據集上進行預訓練。 - 句法分析:句法分析模型在 UD Japanese BCCWJ 數據集上訓練。
- 命名實體識別 (NER):NER 模型在 GSK2014-A (2019) BCCWJ 版本上訓練,支持 Sekine 擴展命名實體層次結構和擴展 OntoNotes5。
適用人群
需要在 Python 環境中使用專業級日語 NLP 功能(如句法分析、分詞和命名實體識別)的開發人員和研究人員。
亮點
- Universal Dependencies:基於 UD 框架,實現一致的句法標註。
- 靈活的模型:可在快速的標準模型和高性能的 Transformer 模型之間進行選擇。
- 命令列工具:包含用於完整句法分析(支持 JSON 和 CaboCha 風格輸出)的
ginza和用於類似 MeCab 分詞的ginzame。 - GPU 加速:支持 CUDA 以加速基於 Transformer 的模型,並支持
thinc-apple-ops以加速 Apple Silicon (M1/M2)。 - 廣泛的整合:與 spaCy 生態系統無縫整合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案