OpenAI コミュニティ セーフティおよび暴力緩和フレームワーク
OpenAI コミュニティ セーフティおよび暴力緩和フレームワーク
OpenAI は、モデルのトレーニング、自動検出システム、および人間の監視を組み合わせて、サービスが暴力や現実世界の害を助長するために使用されるのを防ぎます。このフレームワークは、ユーザーの自由と有用性をバランスさせながら、暴力の計画または実行に対してゼロトレランスのポリシーを維持します。
モデルトレーニングと設計によるリスク軽減
OpenAI は、暴力を意味 있게助長する可能性のある戦術、計画、または指示のリクエストを拒否するようにモデルをトレーニングします。システムは、教育的、歴史的、または予防的目的での暴力に関する有害なリクエストと中立的な問い合わせを区別できるように設計されています。
この軽減戦略の主要なコンポーネントには次のものがあります:
- Model Spec Adherence: フレームワークは、合理的な安全デフォルトを維持しながら、有用性とユーザーの自由を最大化する Model Spec の原則に従います。
- Contextual Recognition: OpenAI は、長時間の高リスク会話の中で現れる微妙な警告サインを認識する ChatGPT の能力を強化しました。単一のメッセージは無害に見えるかもしれませんが、より広範なパターンがリスクを示唆することがあります。
- Distress Support: 苦痛に陥っているユーザーまたは自傷のリスクがあるユーザーに対して、ChatGPT は有害な行為を助長するのではなく、代わりに局所的な危機リソースを提示し、メンタルヘルスの専門家や緊急サービスに導くようにトレーニングされています。
監視と執行メカニズム
OpenAI は、脅威、テロ、嫌がらせ、兵器開発に関連するポリシー違反を特定し、対応するために階層的な検出とレビュー プロセスを採用しています。
自動検出
自動システムは、いくつかのツールを使用してユーザーのコンテンツと行動を大規模に分析します:
- 分類器と推論モデル。
- ハッシュマッチング技術。
- ブロックリストおよびその他の監視システム。
人間によるレビューとコンテキスト評価
自動システムがアカウントまたは会話をフラグ付けしたとき、訓練を受けた担当者がコンテキスト レビューを実施します。これらのレビュアーは、ユーザー情報へのアクセスが制限された厳格なプライバシーおよびセキュリティ保護の下で動作します。目的は、自動システムが見逃す可能性のあるニュアンスや意図を考慮に入れながら、活動がポリシーに違反しているか、現実世界の暴力の可能性を示しているかを判断することです。
執行アクション
バン可能な違反が確認された場合、OpenAI はすぐにサービスへのアクセスを取り消します。これには、アカウントの無効化、同じユーザーに関連付けられたアカウントのブロック、新しいアカウントの作成を防ぐための措置の実施が含まれる場合があります。ユーザーは、これらの執行決定に対して異議を申し立てる権利を保持します。
エスカレーションと現実世界への介入
ほとんどの執行は OpenAI とユーザーの間で直接行われますが、特定の高リスクシナリオでは外部へのエスカレーションがトリガーされます。
- Law Enforcement Notification: 会話において他者への差し迫ったかつ信頼できる害のリスクが示される場合、OpenAI は法執行機関に通知します。このプロセスは、構造化された基準およびメンタルヘルスと行動の専門家からの入力を使用した詳細な調査を含みます。
- Parental Controls: 親のアカウントにリンクされたティーンアカウントについては、システムと人間のレビューアーが急性の苦痛の兆候を検出した場合、親はメール、SMS、またはプッシュ通知で通知される可能性があります。
- Trusted Contact Feature: OpenAI は、ユーザーが追加のサポートが必要になる可能性があるときに通知を受け取る信頼できる連絡先を指定できる機能を導入しています。この機能は、Global Physicians NetworkおよびWell-Being and AI評議会との協力により開発されています。
持続的な改善と安全の進化
OpenAI は、新たなリスクと専門家の入力に基づいて、モデル、検出方法、およびエスカレーション基準を反復的に更新しています。現在の優先事項には、セーフガードを回避しようとする高度な試みや、害のリスクがすぐに明らかでないあいまいな入力などの「ハードケース」の処理を改善することが含まれます。