Anthropic 宣布儿童安全原则倡议
TL;DR
Anthropic 加入了由 Thorn 和 All Tech Is Human 领导的联盟,旨在采用明确的儿童安全承诺,概述了在阻止生成 AI 产生的儿童性虐待内容 (AIG-CSAM) 的创建和传播方面的具体开发、部署和维护行动。
承诺概述
Anthropic 公开承诺在其生成式 AI 模型的生命周期内实施强大的儿童安全措施。该承诺与更广泛的行业努力相一致,旨在减轻 AI 系统可能被用于制作或传播儿童性虐待内容 (CSAM) 及相关危害的风险。
政策基础
- Anthropic 的《可接受使用政策》严格禁止任何描述、鼓励、支持或传播儿童性剥削或虐待的内容。
- 检测到的违规行为将报告给国家失踪与受剥削儿童中心 (NCMEC)。
- 虽然 Anthropic 模型可以摄取图像,但目前不生成多模态输出,从而限制了某些滥用途径。
安全设计原则 (Safety-by-Design Principles)
Anthropic 承诺采用 Thorn 发布了的安全设计 (Safety by Design) 框架。该框架在三个阶段定义了可操作的缓解措施:开发、部署和维护。
开发阶段
- 负责任的数据源获取:避免使用专家识别为可能包含 CSAM 或儿童性剥削材料 (CSEM) 的数据进行训练。
- 摄取保护措施:在训练数据被使用之前,检测、移除并报告发现的 CSAM/CSEM。
- 红队测试:针对 AIG-CSAM 和 CSEM 的生成进行结构化、可扩展的压力测试。
- 政策定义:建立明确的训练数据和模型开发政策。
- 客户限制:禁止客户使用 Anthropic 模型来促进针对儿童的性危害。
部署阶段
- 内容检测:识别输入和输出中的滥用内容 (CSAM, AIG-CSAM, CSEM)。
- 用户报告机制:为用户提供标记或报告可疑内容的选项。
- 执行力:实施强制执行政策违规行为的机制。
- 预防性提示:部署警告和指导,以威慑 CSAM 的索求。
- 分阶段推出:在广泛发布之前,在早期部署阶段监控滥用行为。
- 模型卡片:在模型文档中添加专门的儿童安全章节。
维护阶段
- 向 NCMEC 报告:在提交报告时使用生成式 AI 文件注释 (Generative AI File Annotation)。
- 持续检测与移除:持续识别、报告并消除 CSAM、AIG-CSAM 和 CSEM。
- 工具投资:构建工具以保护内容免受 AI 生成的篡改。
- 缓解措施质量:定期评估并改进安全措施的有效性。
- 禁止欺骗行为:不允许使用生成式 AI 欺骗他人,以达到性危害儿童的目的。
- OSINT 监控:利用开源情报 (OSINT) 来追踪 Anthropic 的平台可能如何被滥用。
参考资料
“安全设计原则”全套内容及详细的缓解策略记录在白皮书**“Safety by Design for Generative AI: Preventing Child Sexual Abuse”** (Thorn) 中。该白皮书可在以下网址获取:https://info.thorn.org/hubfs/thorn-safety-by-design-for-generative-AI.pdf。
Anthropic 相关公告
- 改进 Fable 5 的生物学保护措施 – 为 Fable 5 模型系列提供进一步的技术保护措施。
- Mariano-Florentino (Tino) Cuéllar 被任命为首席全球事务官 – 领导层扩张以支持全球政策倡议。
这些相关文章说明了 Anthropic 在其 AI 产品组合中对安全和治理的广泛关注。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch