OpenAI プライバシーフィルター リリース

OpenAI プライバシーフィルター リリース

OpenAI は、非構造化テキスト中の個人識別情報(PII)を検出し削除することを目的としたオープンウェイトモデル「OpenAI Privacy Filter」をリリースしました。このツールはローカルで実行できるよう設計されており、開発者はデータをローカル環境から外部に出すことなく PII をマスクできるため、トレーニング、インデックス作成、ロギング、レビュー パイプラインにおける情報漏洩リスクを低減します。

モデルアーキテクチャと技術仕様

Privacy Filter は、スパンデコーディングを備えた双方向トークン分類モデルです。オートリグレッシブな事前学習チェックポイントをプライバシーラベルの固定タクソノミー上のトークン分類器に適応させて開発されました。テキストを生成する代わりに、モデルは入力シーケンスに対して単一のフォワードパスでラベル付けを行い、制約付きビタビ手法を用いて一貫したスパンをデコードします。

Key technical properties include:

  • Efficiency: すべてのトークンが単一パスでラベル付けされるため、プロダクションでの使用に高速です。
  • Context Awareness: モデルは言語事前知識を利用し、周囲のコンテキストに基づいて PII スパンを検出し、公開情報と個人のプライベートデータを区別します。
  • Capacity: コンテキストウィンドウは最大 128,000 トークンまでサポートします。
  • Model Size: モデルは合計 1.5B パラメータ(うちアクティブは 50M)で構成されています。
  • Configurability: 開発者は特定のワークフローに合わせて、精度と再現率のトレードオフを調整できるように動作点を設定できます。

PII 検出カテゴリ

Privacy Filter は、機密情報の 8 つの特定カテゴリにわたるスパンを予測します。

  • private_person
  • private_address
  • private_email
  • private_phone
  • private_url
  • private_date
  • account_number(銀行口座番号およびクレジットカード番号を含む)
  • secret(パスワードや API キーを含む)

これらのラベルは BIOES スパンタグを使用してデコードされ、クリーンで一貫したマスク境界が保証されます。

トレーニング手法

OpenAI は、モデルを主に 3 つの段階で開発しました:

  1. Taxonomy Definition: 個人識別子、連絡先情報、シークレット用のプライバシーラベルセットを確立すること。
  2. Conversion: 事前学習モデルの言語モデリングヘッドをトークン分類ヘッドに置き換え、教師あり分類目的を適用すること。
  3. Data Mixture: 公開データと合成データの組み合わせでトレーニングすること。モデル支援アノテーションとレビューを用いて公開データのカバレッジを向上させ、合成データはフォーマットやコンテキストの多様性を高めました。

パフォーマンスとベンチマーク

PII-Masking-300k ベンチマークにおいて、Privacy Filter は F1 スコア 96%(精度 94.04%、再現率 98.04%)を達成しています。OpenAI が特定したアノテーション問題を修正した場合、F1 スコアは 97.43%(精度 96.79%、再現率 98.08%)に向上します。

さらに、モデルは高い適応性を持ちます。少量のドメイン固有データでファインチューニングすることで、ドメイン適応ベンチマークにおける F1 スコアを 54% から 96% に向上させることができます。

制限事項と想定使用

Privacy Filter は、プライバシー・バイ・デザインシステムの一部として想定されており、単体の匿名化ツール、コンプライアンス認証、またはポリシーレビューの代替としては使用すべきではありません。

  • Taxonomy Dependence: パフォーマンスは、トレーニング時に使用されたラベルタクソノミーと決定境界に依存します。
  • Distribution Shift: 異なる言語、文字体系、命名規則において精度が変動する可能性があります。
  • Potential for Errors: モデルは稀な識別子を見逃したり、コンテキストが限られた短いシーケンスで過剰にマスクすることがあります。

OpenAI は、医療、法務、金融などの高感度領域においては、人間によるレビューとドメイン固有のファインチューニングが依然として不可欠であると述べています。

利用可能性

OpenAI Privacy Filter は Apache 2.0 ライセンスの下でリリースされており、実験、カスタマイズ、商用展開のために Hugging Face と GitHub で利用可能です。

Sources