urchade/GLiNER

Generalist and Lightweight Model for Named Entity Recognition (Extract any entity types from texts)

何を解決するか

GLiNERは、従来の命名エンティティ認識(NER)モデルの限界を克服するように設計されています。これらのモデルは通常、新しいエンティティタイプごとに大量のラベル付きデータとタスク固有の学習が必要です。GLiNERは、新しい学習データを必要とせずに、あらゆるエンティティタイプをゼロショットで抽出できる軽量で汎用的なフレームワークを提供します。

動作方法

GLiNERはトランスフォーマーに基づくアーキテクチャを使用してトークン分類を実行します。以下の専門的なアーキテクチャを提供しています:

  • Uni-encoder:強力なゼロショット機能を持つオリジナルアーキテクチャ。
  • Bi-encoder:ラベルの埋め込みを事前に計算することで、数百~数千のエンティティタイプにスケーリング可能。
  • RelEx:エンティティとそれらの間の関係を同時に抽出する統合アーキテクチャ。
  • GLiNER Decoder:最大の柔軟性を実現するため、エンティティタイプを生成するハイブリッドアーキテクチャ。
  • StreamingSpan:インクリメンタルNERと継続的な予測更新に対応する因果スパンモデル。

パフォーマンス最適化のため、torch.compile、FP16およびINT8量子化、ONNXエクスポートをサポートしており、CPUやコンシューマー向けハードウェアでのデプロイが可能になります。

対象ユーザー

このツールは、PII検出、知識グラフ構築、複数言語におけるドメイン固有NER(例:法的・医療分野)などの情報抽出タスクに取り組む開発者やデータサイエンティスト向けです。

特徴

  • ゼロショット認識:ラベル付きデータなしであらゆるエンティティタイプを抽出可能。
  • 高いスケーラビリティ:Bi-encoderアーキテクチャにより、数百万のラベルを性能低下なしにサポート。
  • 統合抽出:一度の処理でエンティティと関係を同時に抽出。
  • プロダクション対応:動的バッチ処理と水平スケーリングを備えたRay Serveベースのサービング層を含む。
  • ハードウェア効率:量子化とコンパイルにより、CPUやコンシューマー向けハードウェアに最適化。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト