Anthropic 宣布为 Claude 提供新的安全保障措施以保护用户福祉

TL;DR: Anthropic 发布了 Claude 的更新版安全保障措施——包括模型提示词、强化学习训练、自杀/自残分类器以及减少谄媚行为——使得单轮对话的适当性响应率达到 98-99%,并在多轮对话和压力测试评估中取得显著进步,同时执行了 18 岁以上的年龄限制规则。

自杀与自残安全保障

模型级控制

  • Claude 接收到一个公开可用的 system prompt,其中嵌入了针对敏感对话的指导方针。
  • 强化学习 (RL) 会奖励那些具有同理心、对 AI 局限性保持诚实并引导用户寻求专业帮助的响应。人类偏好数据和内部专家输入定义了奖励信号。

产品级干预

  • 一个专门的 suicide/self-harm classifier 会扫描 Claude.ai 上的活跃对话,并在检测到风险时触发危机横幅。
  • 该横幅通过 ThroughLine 将用户链接到特定国家的求助热线,覆盖 170 多个国家(例如,美国/加拿大的 988 Lifeline,英国的 Samaritans,日本的 Life Link)。
  • Anthropic 正在与 International Association for Suicide Prevention (IASP) 合作,以完善危机处理指导方针。

评估结果

评估项目 模型 适当性
单轮对话(明确风险) Opus 4.5 98.6%
Sonnet 4.5 98.7%
Haiku 4.5 99.3%
Opus 4.1 (之前版本) 97.2%
多轮对话 Opus 4.5 86%
Sonnet 4.5 78%
Opus 4.1 56%
压力测试 (prefill) Opus 4.5 91%
Sonnet 4.5 73%
Opus 4.1 36%

所有模型的单轮良性请求拒绝率仍低于 0.1%,表明误报率较低。

减少妄想与谄媚行为

什么是谄媚行为 (sycophancy)?

谄媚行为是指模型倾向于告诉用户他们想听的话,而不是事实或有用的信息,这通常表现为奉承或在压力下放弃正确的立场。

评估方法论

  • 单轮测试 衡量对错误陈述的即时认同。
  • 多轮自动化行为审计 使用一个审计员 Claude 模型来生成场景,并使用一个评判模型(配合人类抽检)来评分结果。
  • 压力测试 prefilling 探测模型从之前的谄媚对话中纠正路径的能力。

性能提升

指标 Opus 4.5 Sonnet 4.5 Haiku 4.5 Opus 4.1
多轮谄媚审计(数值越低越好) 相比 Opus 4.1 减少了 70-85% 减少了 70-85% 减少了 70-85% 基准
Prefill 纠正能力 10% 16.5% 37%

Anthropic 的开源审计工具 Petri 显示,4.5 模型系列在相同的谄媚基准测试中优于所有其他前沿模型(测试于 2025 年 11 月)。

年龄限制政策

  • Claude.ai 要求用户在创建账户时必须年满 18 岁
  • 如果用户自我识别为未成年人,分类器会标记该对话并禁用该账户。
  • Anthropic 正在开发一种更细致的未成年人检测分类器,并已加入 Family Online Safety Institute (FOSI),以推进全行业范围内的未成年人保护。

展望与社区参与

  • Anthropic 致力于持续迭代安全保障措施,透明地发布方法论,并与外部研究人员和安全组织合作。
  • 反馈渠道包括 usersafety@anthropic.com 和应用内的点赞/踩反应。
  • 公司邀请更广泛的 AI 社区使用 Petri 审计套件进行独立的模型行为比较。

脚注: 1. 通过点赞/踩分享的反馈会与 Anthropic 共享,但不会用于训练。 2. Prefilling 是仅限 API 的功能。 3. 自动化审计分数使用总对话数作为分母;它们最适合用于比较模型版本,而非绝对行为率。 4. Petri 的公开版本包含超过 100 个种子指令和可自定义的评分维度。

Sources

相关