OpenAIモデルで動作するSafetyKitリスクエージェント

SafetyKitは、リスクカテゴリに基づいてコンテンツを特定のエージェントに振り分けるモデルマッチングアプローチを採用しています。このアーキテクチャにより、タスクの要件がモデル選択を決定し、推論、処理量、モダリティの最適化が実現されます。

  • GPT-5: テキスト、画像、UIを横断したマルチモーダル推論に使用され、隠れたリスクを特定し、精緻で階層的な意思決定を支援します。
  • GPT-4.1: 高ボリュームのモデレーションワークフローに使用され、詳細なコンテンツポリシー指示への確実な遵守を実現します。
  • Reinforcement Fine-Tuning (RFT): 複雑な安全ポリシーに対し、デフォルトのモデル能力を超える再現率と精度を向上させるために適用されます。
  • Deep Research: マーチャントの検証やレビューに対するリアルタイムのオンライン調査に統合されています。
  • Computer Using Agent (CUA): 複雑なポリシータスクを自動化し、手動による人間レビューの必要性を削減します。

マルチモーダルリスク検出とポリシー執行

SafetyKitエージェントは、レガシーのキーワードベースシステムが見逃しがちな複雑な安全タスクを処理します。例えば、詐欺画像に埋め込まれた電話番号の検出や、地域別のコンプライアンス規則の適用などです。

詐欺検出

詐欺検出エージェントは、視覚的分析とテキスト分析を組み合わせます。GPT-4.1を使用して画像を解析し、レイアウトを理解し、製品画像に埋め込まれたQRコードや電話番号などのポリシー違反を特定します。

ポリシー開示

ポリシー開示エージェントは、出品やランディングページに必須の法的免責事項や地域別の警告が含まれていることを保証します。ワークフローは、GPT-4.1が関連セクションを抽出し、続いてGPT-5が内部ポリシーライブラリと照らし合わせて、必要な文言が存在し、特定の地域で必須かどうかを評価します。

パフォーマンス向上とスケーラビリティ

SafetyKitは、新しいOpenAIモデルの導入により、運用規模とパフォーマンスの大幅な向上を実現しています。

  • Vision Task Improvements: GPT-5の導入により、最も難易度の高いビジョンタスクでベンチマークスコアが10ポイント以上向上しました。
  • Token Volume: 日次トークン処理量は、6か月で2億から160億トークン以上へと拡大しました。
  • Rapid Integration: SafetyKitは、新リリース(o3やGPT-5を含む)を最も難しいケースでベンチマークし、トップパフォーマンスのモデルをリリース当日に展開することが多いです。

"OpenAIはスピーディに進化しており、我々はそれに追随できるようシステムを設計しました。新しいリリースが出るたびに、これまでサポートできなかった新機能や領域が解放され、顧客に提供するカバレッジと精度が向上します。" —David Graunke、SafetyKit創業者兼CEO

安全運用への影響

すべての顧客コンテンツのレビューを自動化することで、SafetyKitは人間のモデレーターが不快な素材にさらされるリスクを減らし、微妙なポリシー判断に集中できるようにします。現在、支払いリスク、詐欺、マネーロンダリング防止、児童搾取防止など、幅広いリスク領域をカバーし、数億人のエンドユーザーを抱える顧客を保護しています。

Sources