Anthropic 公佈兒童安全原則倡議
TL;DR
Anthropic 加入了由 Thorn 和 All Tech Is Human 領導的聯盟,旨在採納明確的兒童安全承諾,概述了在開發、部署和維護階段採取具體行動,以阻止生成式 AI 產生的兒童性虐待內容 (AIG-CSAM)。
承諾概述
Anthropic 公開承諾在其生成式 AI 模型的生命週期中實施強大的兒童安全措施。此項承諾與更廣泛的產業努力相一致,旨在減輕 AI 系統可能被用於製作或散布兒童性虐待內容 (CSAM) 及相關傷害的風險。
政策基礎
- Anthropic 的《可接受使用政策》嚴格禁止任何描述、鼓勵、支持或散布兒童性剝削或虐待的內容。
- 檢測到的違規行為將通報至National Center for Missing & Exploited Children (NCMEC)。
- 雖然 Anthropic 模型可以攝取影像,但目前並不生成多模態輸出,這限制了某些濫用途徑。
安全設計原則 (Safety-by-Design Principles)
Anthropic 承諾遵循 Thorn 發佈的Safety by Design 框架。該框架在三個階段定義了可執行的緩解措施:開發、部署和維護。
開發階段 (Develop Phase)
- 負責任的數據來源:避免使用專家認定可能包含 CSAM 或兒童性剝削內容 (CSEM) 的數據進行訓練。
- 攝取防護:在數據被使用之前,檢測、移除並通報在訓練數據中發現的 CSAM/CSEM。
- 紅隊測試 (Red-team testing):針對 AIG-CSAM 和 CSEM 生成進行結構化、可擴展的壓力測試。
- 政策定義:建立明確的訓練數據和模型開發政策。
- 客戶限制:禁止客戶使用 Anthropic 模型來促進對兒童的性傷害。
部署階段 (Deploy Phase)
- 內容檢測:在輸入和輸出中識別濫用內容 (CSAM, AIG-CSAM, CSEM)。
- 用戶通報機制:提供選項讓用戶可以標記或通報可疑內容。
- 執行力:實施機制以強制執行政策違規行為。
- 預防性訊息:部署警告和指南以威懾 CSAM 徵求行為。
- 分階段推出:在廣泛發布之前,於早期部署階段監控濫用行為。
- 模型卡片 (Model cards):在模型文檔中增加專門的兒童安全章節。
維護階段 (Maintain Phase)
- 向 NCMEC 通報:提交報告時使用Generative AI File Annotation。
- 持續檢測與移除:持續識別、通報並消除 CSAM, AIG-CSAM, 和 CSEM。
- 工具投資:開發工具以保護內容免受 AI 生成的操縱。
- 緩解措施品質:定期評估並改進安全措施的有效性。
- 禁止欺騙行為:禁止使用生成式 AI 來欺騙他人以達到性傷害兒童的目的。
- OSINT 監控:利用開源情報 (OSINT) 來追蹤 Anthropic 的平台可能如何被濫用。
參考資料
Safety by Design 原則的完整集與詳細的緩解策略已記錄在白皮書**「Safety by Design for Generative AI: Preventing Child Sexual Abuse」** (Thorn) 中。該文件可於此處取得:https://info.thorn.org/hubfs/thorn-safety-by-design-for-generative-AI.pdf。
Anthropic 相關公告
- 改進 Fable 5 的生物學防護措施 – 為 Fable 5 模型系列提供進一步的技術防護措施。
- Mariano-Florentino (Tino) Cuéllar 被任命為全球事務官 (Chief Global Affairs Officer) – 擴展領導層以支持全球政策倡議。
這些相關貼文說明了 Anthropic 在其 AI 產品組合中對安全與治理的廣泛關注。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch