Anthropic 公佈兒童安全原則倡議

TL;DR

Anthropic 加入了由 Thorn 和 All Tech Is Human 領導的聯盟,旨在採納明確的兒童安全承諾,概述了在開發、部署和維護階段採取具體行動,以阻止生成式 AI 產生的兒童性虐待內容 (AIG-CSAM)。

承諾概述

Anthropic 公開承諾在其生成式 AI 模型的生命週期中實施強大的兒童安全措施。此項承諾與更廣泛的產業努力相一致,旨在減輕 AI 系統可能被用於製作或散布兒童性虐待內容 (CSAM) 及相關傷害的風險。

政策基礎

  • Anthropic 的《可接受使用政策》嚴格禁止任何描述、鼓勵、支持或散布兒童性剝削或虐待的內容。
  • 檢測到的違規行為將通報至National Center for Missing & Exploited Children (NCMEC)
  • 雖然 Anthropic 模型可以攝取影像,但目前並不生成多模態輸出,這限制了某些濫用途徑。

安全設計原則 (Safety-by-Design Principles)

Anthropic 承諾遵循 Thorn 發佈的Safety by Design 框架。該框架在三個階段定義了可執行的緩解措施:開發、部署和維護。

開發階段 (Develop Phase)

  • 負責任的數據來源:避免使用專家認定可能包含 CSAM 或兒童性剝削內容 (CSEM) 的數據進行訓練。
  • 攝取防護:在數據被使用之前,檢測、移除並通報在訓練數據中發現的 CSAM/CSEM。
  • 紅隊測試 (Red-team testing):針對 AIG-CSAM 和 CSEM 生成進行結構化、可擴展的壓力測試。
  • 政策定義:建立明確的訓練數據和模型開發政策。
  • 客戶限制:禁止客戶使用 Anthropic 模型來促進對兒童的性傷害。

部署階段 (Deploy Phase)

  • 內容檢測:在輸入和輸出中識別濫用內容 (CSAM, AIG-CSAM, CSEM)。
  • 用戶通報機制:提供選項讓用戶可以標記或通報可疑內容。
  • 執行力:實施機制以強制執行政策違規行為。
  • 預防性訊息:部署警告和指南以威懾 CSAM 徵求行為。
  • 分階段推出:在廣泛發布之前,於早期部署階段監控濫用行為。
  • 模型卡片 (Model cards):在模型文檔中增加專門的兒童安全章節。

維護階段 (Maintain Phase)

  • 向 NCMEC 通報:提交報告時使用Generative AI File Annotation
  • 持續檢測與移除:持續識別、通報並消除 CSAM, AIG-CSAM, 和 CSEM。
  • 工具投資:開發工具以保護內容免受 AI 生成的操縱。
  • 緩解措施品質:定期評估並改進安全措施的有效性。
  • 禁止欺騙行為:禁止使用生成式 AI 來欺騙他人以達到性傷害兒童的目的。
  • OSINT 監控:利用開源情報 (OSINT) 來追蹤 Anthropic 的平台可能如何被濫用。

參考資料

Safety by Design 原則的完整集與詳細的緩解策略已記錄在白皮書**「Safety by Design for Generative AI: Preventing Child Sexual Abuse」** (Thorn) 中。該文件可於此處取得:https://info.thorn.org/hubfs/thorn-safety-by-design-for-generative-AI.pdf。

Anthropic 相關公告

  • 改進 Fable 5 的生物學防護措施 – 為 Fable 5 模型系列提供進一步的技術防護措施。
  • Mariano-Florentino (Tino) Cuéllar 被任命為全球事務官 (Chief Global Affairs Officer) – 擴展領導層以支持全球政策倡議。

這些相關貼文說明了 Anthropic 在其 AI 產品組合中對安全與治理的廣泛關注。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch