OpenAI プライバシーフィルター リリース
OpenAI プライバシーフィルター リリース
OpenAI は、非構造化テキスト中の個人識別情報(PII)を検出し削除することを目的としたオープンウェイトモデル「OpenAI Privacy Filter」をリリースしました。このツールはローカルで実行できるよう設計されており、開発者はデータをローカル環境から外部に出すことなく PII をマスクできるため、トレーニング、インデックス作成、ロギング、レビュー パイプラインにおける情報漏洩リスクを低減します。
モデルアーキテクチャと技術仕様
Privacy Filter は、スパンデコーディングを備えた双方向トークン分類モデルです。オートリグレッシブな事前学習チェックポイントをプライバシーラベルの固定タクソノミー上のトークン分類器に適応させて開発されました。テキストを生成する代わりに、モデルは入力シーケンスに対して単一のフォワードパスでラベル付けを行い、制約付きビタビ手法を用いて一貫したスパンをデコードします。
Key technical properties include:
- Efficiency: すべてのトークンが単一パスでラベル付けされるため、プロダクションでの使用に高速です。
- Context Awareness: モデルは言語事前知識を利用し、周囲のコンテキストに基づいて PII スパンを検出し、公開情報と個人のプライベートデータを区別します。
- Capacity: コンテキストウィンドウは最大 128,000 トークンまでサポートします。
- Model Size: モデルは合計 1.5B パラメータ(うちアクティブは 50M)で構成されています。
- Configurability: 開発者は特定のワークフローに合わせて、精度と再現率のトレードオフを調整できるように動作点を設定できます。
PII 検出カテゴリ
Privacy Filter は、機密情報の 8 つの特定カテゴリにわたるスパンを予測します。
private_personprivate_addressprivate_emailprivate_phoneprivate_urlprivate_dateaccount_number(銀行口座番号およびクレジットカード番号を含む)secret(パスワードや API キーを含む)
これらのラベルは BIOES スパンタグを使用してデコードされ、クリーンで一貫したマスク境界が保証されます。
トレーニング手法
OpenAI は、モデルを主に 3 つの段階で開発しました:
- Taxonomy Definition: 個人識別子、連絡先情報、シークレット用のプライバシーラベルセットを確立すること。
- Conversion: 事前学習モデルの言語モデリングヘッドをトークン分類ヘッドに置き換え、教師あり分類目的を適用すること。
- Data Mixture: 公開データと合成データの組み合わせでトレーニングすること。モデル支援アノテーションとレビューを用いて公開データのカバレッジを向上させ、合成データはフォーマットやコンテキストの多様性を高めました。
パフォーマンスとベンチマーク
PII-Masking-300k ベンチマークにおいて、Privacy Filter は F1 スコア 96%(精度 94.04%、再現率 98.04%)を達成しています。OpenAI が特定したアノテーション問題を修正した場合、F1 スコアは 97.43%(精度 96.79%、再現率 98.08%)に向上します。
さらに、モデルは高い適応性を持ちます。少量のドメイン固有データでファインチューニングすることで、ドメイン適応ベンチマークにおける F1 スコアを 54% から 96% に向上させることができます。
制限事項と想定使用
Privacy Filter は、プライバシー・バイ・デザインシステムの一部として想定されており、単体の匿名化ツール、コンプライアンス認証、またはポリシーレビューの代替としては使用すべきではありません。
- Taxonomy Dependence: パフォーマンスは、トレーニング時に使用されたラベルタクソノミーと決定境界に依存します。
- Distribution Shift: 異なる言語、文字体系、命名規則において精度が変動する可能性があります。
- Potential for Errors: モデルは稀な識別子を見逃したり、コンテキストが限られた短いシーケンスで過剰にマスクすることがあります。
OpenAI は、医療、法務、金融などの高感度領域においては、人間によるレビューとドメイン固有のファインチューニングが依然として不可欠であると述べています。
利用可能性
OpenAI Privacy Filter は Apache 2.0 ライセンスの下でリリースされており、実験、カスタマイズ、商用展開のために Hugging Face と GitHub で利用可能です。