OpenAI 青少年安全政策套件與 gpt-oss-safeguard

OpenAI 發布了一套基於提示的安全政策,旨在協助開發者為青少年建立符合年齡的保護措施。這些政策與 gpt-oss-safeguard-20b(一個開放權重的安全模型)相容,使開發者能將高層次的安全需求轉換為可在實際 AI 系統中使用的分類器。

透過提示式政策實作青少年安全

OpenAI 將這些安全政策以提示的形式提供,可直接與推理模型及 gpt-oss-safeguard 模型結合使用,以確保一致的安全標準。此方法解決了開發者的一大挑戰:將高層次的安全目標轉化為精確、可操作的規則,並考量青少年獨特的發展需求與風險。

透過將政策結構化為提示,開發者可以:

  • 更輕鬆地將安全檢查整合到現有工作流程中。
  • 將政策調整至特定使用情境。
  • 隨時間迭代安全定義。
  • 同時用於即時內容過濾與離線分析使用者產生的內容。

初始安全政策發布的範圍

初始的安全政策套件涵蓋六個針對青少年常見挑戰而設計的關鍵風險領域:

  • 圖像暴力內容
  • 圖像性內容
  • 有害的身體理想與行為
  • 危險活動與挑戰
  • 浪漫或暴力角色扮演
  • 受年齡限制的商品與服務

專家合作與開發

這些政策在 Common Sense Mediaeveryone.ai 等外部組織的意見下制定,以精練內容範圍、加強提示結構,並識別關鍵的邊緣案例。

關於這些工具的影響,Common Sense Media 的 AI 與數位評估主管 Robbie Torney 表示:

「青少年 AI 安全最大的缺口之一是缺乏開發者可依循的明確、可操作的政策。許多時候,開發者只能從零開始。這些基於提示的政策有助於在整個生態系統中建立有意義的安全底線……」

everyone.AI 的首席科學家 Mathilde Cerioli 博士指出,這些政策有助於「將專家知識轉化為可在實際系統中使用的指導方針」。

作為「深度防禦」策略的實施

OpenAI 強調,這些政策僅是起點,而非完整的安全解決方案。由於每個應用都有其獨特的風險與情境,鼓勵開發者採取「深度防禦」的方式,將這些基於提示的政策與其他防護措施結合,包括:

  • 產品設計決策
  • 使用者控制
  • 青少年友善的透明度
  • 監控系統
  • 符合年齡的回應

這些公開的政策基於 OpenAI 內部的經驗,但並未涵蓋公司內部防護措施的全部範圍.

Sources