data-privacy-stack/presidio-research
This package features data-science related tasks for developing new recognizers for Presidio. It is used for the evaluation of the entire system, as well as for evaluating specific PII recognizers or PII detection models.
何を解決するか
個人識別情報(PII)検出モデルの開発、テスト、評価に標準化されたフレームワークを提供します。開発者が単純なテストから精度と再現率の厳密な評価へと進むのを支援するとともに、高品質な学習データの不足という問題を解決するために、合成PIIデータセットを生成するツールを提供します。
動作方法
このプロジェクトは3段階のパイプラインを実装しています:
- データ生成:文のテンプレート(例:"My name is {{name}}")と偽のPII値を使用して合成データセットを作成します。その後、このデータをトークン化し、IO、BIO、BILUOなどのフォーマットでタグ付けできます。
- データ表現:標準化された
InputSampleオブジェクトを使用して、CoNLL、spaCy v3、JSONなどの異なるフォーマット間でのデータ変換を容易にします。 - 評価:Presidio AnalyzerやカスタムPII認識器のパフォーマンスを測定するためのツールを提供し、詳細なエラー分析や異なるモデル間でのエンティティのマッピングを可能にします。
対象ユーザー
- PII検出モデルや名前付きエンティティ認識(NER)システムの構築・最適化を行う開発者。
- 学習データセット内のエンティティ値のカバレッジを向上させるために合成PIIデータを生成する必要があるデータサイエンティスト。
- 特定の構成の正確性を評価したいPresidioフレームワークのユーザー。
主な特徴
- 合成データジェネレーター:本物の機密データを使用せずに、テンプレートに基づいて偽のPII文を生成し、学習に使用できます。
- マルチフォーマット対応:JSON、CoNLL、spaCyフォーマット間をスムーズに変換できます。
- 漏洩防止:同じテンプレートが複数のfoldに出現しないように、データセットをtrain/test/validationセットに分割するためのツールを提供します。
- 包括的な評価:システム全体および個々の認識器のパフォーマンスに対して、精度、再現率、Fスコアの分析をサポートします。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト