Anthropic 理解与应对 AI 危害的框架

Anthropic 已实施了一套结构化框架,用于识别、评估和缓解广泛的 AI 相关危害,范围涵盖从儿童安全、虚假信息到灾难性的生物威胁。这种方法使实验室能够按比例管理风险,确保安全防护措施不会不必要地阻碍 AI 系统的帮助性和功能性。

用于危害评估的多维框架

Anthropic 通过五个基准维度来评估潜在的 AI 影响,以确保对风险有全面的理解。这种结构化方法使团队能够清晰地沟通,并针对已知和新出现的危害开发有针对性的解决方案。

影响的五个维度是:

  • 身体影响: 对身体健康和福祉的影响。
  • 心理影响: 对心理健康和认知功能的影响。
  • 经济影响: 财务后果和财产考量。
  • 社会影响: 对社区、机构和共享系统的影响。
  • 个人自主权影响: 对个人决策和自由的影响。

为了确定这些影响在现实世界中的重要性,Anthropic 根据包括可能性、规模、受影响人群、持续时间、因果关系、技术贡献和缓解可行性在内的因素来评估每个维度。

与安全政策和执行的集成

该危害评估框架与专门针对灾难性风险的负责任扩展政策 (RSP) 相辅成成。虽然 RSP 管理极端情况,但更广泛的框架通过几种集成的政策和实践来应对更广泛的潜在影响:

  • 使用政策: 维护一套关于可接受使用的全面规则。
  • 评估: 在模型发布前后进行红队测试和对抗性测试。
  • 检测: 利用先进的技术来识别滥用和误用。
  • 执行: 实施从提示词修改到账号封禁的各种措施。

在模型能力和行为中的应用

Anthropic 在开发新功能或优化模型响应时,会将此框架应用于评估模型帮助性与安全限制之间的权衡。

计算机使用能力

在开发模型与计算机界面交互的能力时,Anthropic 会分析涉及的软件和上下文,以识别必要的防护措施。重点关注金融软件和银行平台以防止欺诈和操纵,以及通信工具以防止网络钓鱼和有针对性的影响行动。为了在效用与安全之间取得平衡,Anthropic 采用了新型的执行方法,例如分层摘要 (hierarchical summarization),这可以在保持隐私标准的同时检测到危害。

模型响应边界

Anthropic 使用该框架来管理“过度索引”于无害性(这会导致不必要的拒绝)与过于“乐于助人”(这可能导致有害行为)之间的紧张关系。

在开发 Claude 3.7 Sonnet 时,这种方法被用于在帮助性和安全性的光谱上评估请求。通过改进模型处理模糊提示词的方式,Anthropic 在保持对有害内容强大防护的同时,将不必要的拒绝减少了 45%。这种细致的方法对于保护脆弱群体(包括儿童、边缘化社区和处于危机中的个人)尤为关键。

未来展望与协作

Anthropic 将此框架视为其整体安全策略中不断演进的组成部分。实验室承认,随着 AI 能力的进步,新的和意想不到的挑战将会出现,这需要评估方法和框架的持续适应。Anthropic 已邀请研究人员、政策专家和行业合作伙伴通过 usersafety@anthropic.com 进行协作。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch