Anthropic 为 Claude 设计的安全保障框架

Anthropic 采用多层安全保障策略,确保 Claude 的能力被用于有益目的,同时防止现实世界中的伤害。该方法整合了政策、执行、产品、数据科学、威胁情报和工程等领域的专家,贯穿整个模型生命周期。

政策制定与伤害评估框架

Anthropic 的安全保障团队负责制定使用政策,规范 Claude 应该如何使用以及不应如何使用,特别关注儿童安全、选举完整性和网络安全。政策制定由两个主要机制指导:

  • 统一伤害评估框架: 一种结构化视角,用于评估五个维度上潜在的有害影响:身体、心理、经济、社会以及个体自主性。该框架会考虑滥用的可能性和规模,以指导执行程序。
  • 政策脆弱性测试: Anthropic 与恐怖主义、极端化、儿童安全和心理健康等领域的外部专家合作,对政策进行压力测试。例如,在 2024 年美国大选期间,与战略对话研究所(Institute for Strategic Dialogue)的合作促成了在用户查询选举信息时显示横幅,引导至 TurboVote 等权威来源。

将安全融入模型训练

安全保障通过与微调团队协作,直接整合到训练过程中。该过程包括:

  • 行为引导: 定义模型在训练期间应表现出或避免表现出的具体特质和行为。
  • 迭代优化: 利用评估和检测流程识别有害输出,进而用于更新奖励模型或调整系统提示。
  • 专业领域知识: 与 ThroughLine 等组织合作,优化 Claude 对自残和心理健康相关问题的回应,确保模型提供细致的支持,而非简单的拒绝。

因此,Claude 被训练为拒绝协助非法活动,并能识别试图生成恶意代码、欺诈内容或策划有害行为的尝试。

部署前测试与评估

在任何新模型发布前,都会进行三种主要类型的评估:

  • 安全评估: 在各种场景下测试对使用政策的遵守情况,包括明确违规和多轮对话。这些评估由其他模型进行评分,并辅以人工审核以确保准确性。
  • 风险评估: 针对高风险领域——包括网络伤害以及化学、生物、放射性和核武器及高能炸药(CBRNE)——Anthropic 与政府和私营行业合作伙伴开展 AI 能力提升测试。
  • 偏见评估: 通过对比对立观点的回应,评估其事实性和一致性,测试政治偏见。团队还测试在医疗和就业等情境下与种族、性别和宗教等身份属性相关的偏见。

对于“计算机使用”工具,发布前的评估识别出增强型垃圾信息生成的风险,从而开发了新的检测方法、提示注入防护机制,并具备在滥用账户时禁用该工具的能力。

实时检测与执行

模型部署后,Anthropic 采用自动化系统与人工审核相结合的方式执行使用政策:

  • 分类器: 经过专门微调的 Claude 模型,实时监控对话中特定政策违规行为。这些分类器在处理数万亿个标记的同时,最大限度减少计算开销。
  • 儿童性虐待材料检测: 在自有产品中,图像哈希值会与已知儿童性虐待材料(CSAM)数据库进行比对。
  • 执行措施: 包括“响应引导”,即实时调整系统提示以防止有害输出(或完全停止响应),以及账户级别的操作,如警告或终止。

持续监控与威胁情报

Anthropic 监控流量模式,以识别超越单个提示的复杂攻击模式:

  • Claude Insights: 一种保护隐私的工具,将对话分组为话题集群,分析真实世界使用情况并为防护机制提供依据。
  • 分层摘要: 一种用于监控计算机使用和网络能力的技术,通过将交互浓缩为摘要,识别聚合行为,例如自动化影响力操作。
  • 威胁情报: 团队监控黑客论坛、社交媒体和即时通讯平台,并将内部滥用指标(如活动激增)与外部威胁数据交叉比对,以识别恶意使用行为。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch