megagonlabs/ginza
A Japanese NLP Library using spaCy as framework based on Universal Dependencies
解決する課題
GiNZAは、日本語の自然言語処理(NLP)のためのオープンソースライブラリであり、Universal Dependencies (UD) フレームワークに準拠した、高精度な日本語の言語分析を提供することを目的としています。
仕組み
spaCyフレームワークを基盤として構築されており、日本語テキスト処理のためのいくつかの専門ツールが統合されています:
- トークン化と品詞タグ付け: 高精度なトークン化と品詞タグ付けのためにSudachiPyを使用します。
- モデル: 標準的な速度重視のモデル(
ja_ginza)と、Hugging Face Transformersを使用してmC4データセットで事前学習された高精度なTransformerベースのモデル(ja_ginza_electra)など、複数のモデルオプションを提供します。 - パース: パースモデルはUD Japanese BCCWJデータセットで訓練されています。
- 固有表現認識 (NER): NERモデルはGSK2014-A (2019) BCCWJ版で訓練されており、関根の拡張固有表現階層と拡張OntoNotes5の両方をサポートしています。
対象ユーザー
Python環境内で、依存関係解析、トークン化、固有表現認識などのプロフェッショナルグレードの日本語NLP機能が必要な開発者や研究者です。
ハイライト
- Universal Dependencies: 一貫した統語的アノテーションのためのUDフレームワークに基づいています。
- 柔軟なモデル: 高速な標準モデルと高性能なTransformerモデルの間で選択可能です。
- コマンドラインツール: 完全なパース(JSONおよびCaboChaスタイルの出力付き)を行う
ginzaと、MeCabのようなトークン化を行うginzameが含まれています。 - GPUアクセラレーション: Transformerベースのモデルの加速のためのCUDAと、Apple Silicon (M1/M2) の加速のための
thinc-apple-opsをサポートしています。 - 広範な統合: spaCyエコシステムとシームレスに統合されます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト