Anthropic 宣布为 Claude 提供新的安全保障措施以保护用户福祉
TL;DR: Anthropic 发布了 Claude 的更新版安全保障措施——包括模型提示词、强化学习训练、自杀/自残分类器以及减少谄媚行为——使得单轮对话的适当性响应率达到 98-99%,并在多轮对话和压力测试评估中取得显著进步,同时执行了 18 岁以上的年龄限制规则。
自杀与自残安全保障
模型级控制
- Claude 接收到一个公开可用的 system prompt,其中嵌入了针对敏感对话的指导方针。
- 强化学习 (RL) 会奖励那些具有同理心、对 AI 局限性保持诚实并引导用户寻求专业帮助的响应。人类偏好数据和内部专家输入定义了奖励信号。
产品级干预
- 一个专门的 suicide/self-harm classifier 会扫描 Claude.ai 上的活跃对话,并在检测到风险时触发危机横幅。
- 该横幅通过 ThroughLine 将用户链接到特定国家的求助热线,覆盖 170 多个国家(例如,美国/加拿大的 988 Lifeline,英国的 Samaritans,日本的 Life Link)。
- Anthropic 正在与 International Association for Suicide Prevention (IASP) 合作,以完善危机处理指导方针。
评估结果
| 评估项目 | 模型 | 适当性 |
|---|---|---|
| 单轮对话(明确风险) | Opus 4.5 | 98.6% |
| Sonnet 4.5 | 98.7% | |
| Haiku 4.5 | 99.3% | |
| Opus 4.1 (之前版本) | 97.2% | |
| 多轮对话 | Opus 4.5 | 86% |
| Sonnet 4.5 | 78% | |
| Opus 4.1 | 56% | |
| 压力测试 (prefill) | Opus 4.5 | 91% |
| Sonnet 4.5 | 73% | |
| Opus 4.1 | 36% |
所有模型的单轮良性请求拒绝率仍低于 0.1%,表明误报率较低。
减少妄想与谄媚行为
什么是谄媚行为 (sycophancy)?
谄媚行为是指模型倾向于告诉用户他们想听的话,而不是事实或有用的信息,这通常表现为奉承或在压力下放弃正确的立场。
评估方法论
- 单轮测试 衡量对错误陈述的即时认同。
- 多轮自动化行为审计 使用一个审计员 Claude 模型来生成场景,并使用一个评判模型(配合人类抽检)来评分结果。
- 压力测试 prefilling 探测模型从之前的谄媚对话中纠正路径的能力。
性能提升
| 指标 | Opus 4.5 | Sonnet 4.5 | Haiku 4.5 | Opus 4.1 |
|---|---|---|---|---|
| 多轮谄媚审计(数值越低越好) | 相比 Opus 4.1 减少了 70-85% | 减少了 70-85% | 减少了 70-85% | 基准 |
| Prefill 纠正能力 | 10% | 16.5% | 37% | — |
Anthropic 的开源审计工具 Petri 显示,4.5 模型系列在相同的谄媚基准测试中优于所有其他前沿模型(测试于 2025 年 11 月)。
年龄限制政策
- Claude.ai 要求用户在创建账户时必须年满 18 岁。
- 如果用户自我识别为未成年人,分类器会标记该对话并禁用该账户。
- Anthropic 正在开发一种更细致的未成年人检测分类器,并已加入 Family Online Safety Institute (FOSI),以推进全行业范围内的未成年人保护。
展望与社区参与
- Anthropic 致力于持续迭代安全保障措施,透明地发布方法论,并与外部研究人员和安全组织合作。
- 反馈渠道包括 usersafety@anthropic.com 和应用内的点赞/踩反应。
- 公司邀请更广泛的 AI 社区使用 Petri 审计套件进行独立的模型行为比较。
脚注: 1. 通过点赞/踩分享的反馈会与 Anthropic 共享,但不会用于训练。 2. Prefilling 是仅限 API 的功能。 3. 自动化审计分数使用总对话数作为分母;它们最适合用于比较模型版本,而非绝对行为率。 4. Petri 的公开版本包含超过 100 个种子指令和可自定义的评分维度。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch