OpenAI ティーン安全ポリシーパック と gpt-oss-safeguard

OpenAI は、開発者がティーンエイジャー向けに年齢に適した保護策を作成できるよう設計された、プロンプトベースの安全ポリシーのセットをリリースしました。これらのポリシーは、オープンウェイトの安全モデルである gpt-oss-safeguard-20b と連携して動作するよう構築されており、開発者が高レベルの安全要件を実際の AI システムで使用できる分類器に変換できるようにします。

プロンプトベースのポリシーによるティーン安全の実装

OpenAI は、これらの安全ポリシーをプロンプトとして提供し、推論モデルおよび gpt-oss-safeguard モデルと直接組み合わせて一貫した安全基準を確保できるようにしています。このアプローチは、開発者が直面する主要な課題、すなわち高レベルの安全目標をティーンエイジャー固有の発達的ニーズとリスクを考慮した正確な運用ルールに変換することを解決します。

ポリシーをプロンプトとして構造化することで、開発者は次のことが可能になります:

  • 既存のワークフローに安全チェックをより簡単に統合できる。
  • 特定のユースケースに合わせてポリシーを適応できる。
  • 時間とともに安全定義を反復的に改善できる。
  • リアルタイムのコンテンツフィルタリングと、ユーザー生成コンテンツのオフライン分析の両方にポリシーを活用できる。

初期安全ポリシーリリースの範囲

初期の安全ポリシーセットは、ティーンが直面する一般的な課題に合わせて調整された 6 つの主要リスク領域をカバーしています:

  • グラフィックな暴力コンテンツ
  • グラフィックな性的コンテンツ
  • 有害な身体イメージや行動
  • 危険な活動やチャレンジ
  • ロマンチックまたは暴力的なロールプレイ
  • 年齢制限のある商品やサービス

専門家との協働と開発

これらのポリシーは、Common Sense Mediaeveryone.ai を含む外部組織からの入力を得て開発され、コンテンツの範囲を洗練し、プロンプト構造を強化し、重要なエッジケースを特定しました。

これらのツールの影響について、Common Sense Media の AI & Digital Assessments 部門責任者 Robbie Torney は次のように述べています:

「ティーンエイジャー向け AI 安全性における最大のギャップの一つは、開発者が構築できる明確で運用可能なポリシーが欠如していたことです。多くの場合、開発者はゼロから始めています。これらのプロンプトベースのポリシーは、エコシステム全体に意味のある安全の最低基準を設定するのに役立ちます…」

everyone.AI のチーフサイエンティスト Dr. Mathilde Cerioli は、これらのポリシーが「専門家の知識を実際のシステムで使用できる指針に変換する」ことに役立つと指摘しています。

「ディフェンス・イン・デプス」戦略としての実装

OpenAI は、これらのポリシーが完全な安全ソリューションではなく、出発点であることを強調しています。すべてのアプリケーションには固有のリスクと文脈があるため、開発者は「ディフェンス・イン・デプス」アプローチを採用し、以下を含む追加の保護策と組み合わせてプロンプトベースのポリシーを活用することが推奨されます:

  • 製品設計の決定
  • ユーザーコントロール
  • ティーンフレンドリーな透明性
  • モニタリングシステム
  • 年齢に適した応答

これらの公開ポリシーは OpenAI の内部経験に基づいていますが、同社の内部保護策全体を表すものではありません。

Sources