OpenAI 兒童安全與 CSAM 防制策略

OpenAI 正在實施一套完整的安全框架,以防止兒童性剝削資料(CSAM)與兒童性剝削材料(CSEM)的創建與散布。此策略結合部署前的訓練防護、即時監控以及產業合作夥伴,以阻止利用 AI 進行兒童剝削的行為。

嚴格禁令與執行政策

OpenAI 明確禁止其服務被用於任何剝削、危害或性化 18 歲以下個人的活動。此禁令同時適用於最終使用者以及基於 OpenAI 技術開發的開發者。

禁止的活動

  • CSAM/CSEM: 創建或使用兒童性剝削資料,無論其是否由 AI 生成。
  • Grooming and Roleplay: 進行對未成年人的引誘或未成年性/暴力角色扮演。
  • Minor Safety: 讓未成年人接觸圖像化的自我傷害、性或暴力內容;宣傳不健康的節食或運動;以及羞辱身體類型或外觀。
  • Dangerous Activities: 鼓勵未成年人參與危險挑戰或提供未成年人取得受年齡限制的商品。

執行措施

  • User Bans: 任何嘗試上傳或生成 CSAM/CSEM 的使用者將立即被封禁,並通報給全國失蹤與被剝削兒童中心(NCMEC)。
  • Developer Accountability: 為未成年人開發工具的開發者必須防止產生性露骨或暗示性內容。OpenAI 會通知開發者其使用者的 CSAM/CSEM 嘗試;若未能改善持續的濫用模式,將導致開發者被封禁。
  • Evasion Monitoring: OpenAI 的調查團隊會監控試圖透過建立新帳號來規避封禁的使用者。

技術防護與偵測方法

OpenAI 採用多層面的技術方法,以確保模型無法被用於生成或分析剝削性材料。

訓練資料完整性

為防止模型具備產生 CSAM 或 CSEM 的能力,OpenAI 會偵測並從訓練資料集中移除此類材料。在此過程中發現的已確認 CSAM 會通報給 NCMEC。

即時偵測與阻擋

OpenAI 使用多項技術在產品環境中識別並阻止濫用:

  • Hash Matching: 用於識別內部團隊或透過 Thorn 經審核的資料庫標記的已知 CSAM。
  • Content Classifiers: OpenAI 使用 Thorn 的 CSAM 內容分類器,以偵測可能新出現的 CSAM 上傳至其產品。
  • AI-Driven Monitoring: OpenAI 自家的模型被部署以更快速偵測濫用模式。
  • Human Review: 內部人工專家僅在分類器標記潛在濫用時審查內容。

對新興濫用模式的回應

OpenAI 已辨識並分享需要持續演進安全回應的特定濫用模式:

  • Descriptive Analysis: 部分使用者嘗試上傳 CSAM 並要求模型產生該材料的詳細描述。OpenAI 透過雜湊比對與 Thorn 的分類器阻擋此類請求。
  • Narrative Integration: 使用者可能透過上傳 CSAM 作為敘事的一部分,試圖誘導模型參與虛構的性角色扮演或涉及未成年人的虐待情節故事。

為了對抗這些情形,OpenAI 結合情境感知分類器與濫用監控,並搭配提示層級的偵測,以確保對濫用的韌性。

公共政策與產業合作

OpenAI 主張制定公共政策框架,以促進科技公司、執法機關與倡議組織之間更深入的合作。

紅隊挑戰

OpenAI 指出,由於在美國持有 CSAM 為非法行為,使用 CSAM(即使是模擬材料)對 AI 模型進行「紅隊」測試目前亦屬違法。此限制使得徹底驗證安全措施變得困難。

立法支持

OpenAI 支持如紐約州《兒童性剝削資料防制法》等立法,該法旨在為採取主動偵測、分類、監控與減輕有害 AI 生成內容之公司的行動提供法定保護。

Sources