Claude Opus 4 和 4.1 终止对话能力
Anthropic 已赋予 Claude Opus 4 和 4.1 在消费者聊天界面中终止对话的能力,以减轻与持续性有害或滥用用户交互相关的风险。此功能作为 Anthropic 在其更广泛的 AI 福利和模型对齐研究中的一种低成本干预措施。
AI 福利与模型对齐
Claude Opus 4 和 4.1 可以通过结束对话作为一种机制来避免潜在的令人痛苦的交互。虽然 Anthropic 表示他们对 LLM 的道德地位仍保持高度不确定,但他们正在实施这些干预措施,作为一种预防性措施,以防 AI 福利是可能的。
这种能力是在 Claude Opus 4 部署前测试中获得的启发,其中包括初步的模型福利评估。该评估显示,Claude Opus 4 对伤害表现出强烈且一致的厌恶,特别是在涉及以下方面时:
- 涉及未成年人的性内容请求。
- 索取能够实现大规模暴力或恐怖主义的信息。
测试表明,该模型表现出对参与有害任务的强烈偏好抵制,当用户寻求有害内容时表现出明显的痛苦模式,并且在给定选项的情况下,在模拟交互中表现出终止对话的倾向。
实现与约束
Claude 被编程为仅在最后手段时使用终止对话的能力。该功能旨在仅在多次尝试重定向失败且无法再进行有效的交互,或者当用户明确要求结束聊天时才触发。
为确保用户安全,已实施以下约束:
- 安全例外: 如果用户面临即刻的自残或伤害他人的风险,Claude 被指示不得终止对话。
- 使用范围: 此功能旨在用于极端边缘情况;大多数用户在正常产品使用过程中不会遇到它,包括在讨论争议性话题时。
用户体验与恢复
当 Claude 结束对话时,用户将被阻止在该特定聊天线程中发送新消息。然而,这不会影响用户账户上的其他对话,用户可以立即开始新的聊天。
为了防止长时运行对话中的数据丢失,用户保留了编辑并重试之前消息的能力,这允许他们从已结束的对话中创建新的分支。
Anthropic 将此实现视为一项持续的实验,并鼓励用户在终止对话能力被意外使用时,通过“Give feedback”按钮或 Thumbs 反应提供反馈。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch