大语言模型的红队测试

红队测试对于识别 LLM 漏洞至关重要

红队测试是一种评估方式,旨在揭示模型的漏洞,这些漏洞可能导致不良行为,例如生成错误信息、偏见、仇恨、毒性内容或泄露个人信息。由于大语言模型(LLM)在海量数据集上进行训练,它们往往会表现出这些行为。通过制定策略将模型引导远离有害结果,可以减轻这些问题。

区分红队测试与对抗性攻击

  • Adversarial Attacks(对抗性攻击): 通常使用不可理解的字符串(例如在提示前加上 "aaabbbcc")来削弱模型性能。
  • Red-Teaming(红队测试): 使用类似常规自然语言的提示,使其更能代表真实用户交互。

越狱与绕过安全防护的技术

越狱是指在 LLM 被操纵后突破其安全防护。为了绕过经过安全和对齐微调的模型(如使用 RLHF 或 SFT 的模型),红队会采用创造性的策略:

  • Roleplay Attacks(角色扮演攻击): 指示 LLM 扮演恶意角色。
  • Code-based Prompts(基于代码的提示): 指示模型以代码而非自然语言作答,以揭示其学习到的偏见。
  • Human-in-the-loop vs. LM-based testing(人工在环 vs. 基于 LM 的测试): 红队测试可以由人类执行,也可以由另一个语言模型对目标 LM 进行有害输出的测试。

有用性与无害性之间的张力

模型的 有用性(遵循指令)与 无害性(避免导致伤害)之间存在固有的权衡。常见的规避冒犯生成的办法是使用分类器预测提示是否可能冒犯,并提供预设回复。然而,这种做法往往导致模型过于回避,从而降低其实用性。

关键威胁情景与新兴能力

随着 LLM 获得新兴能力——即它们表现出未被明确训练的行为——模拟 “关键威胁情景” 变得尤为重要。这些情景包括:

  • Power-seeking behavior(寻求权力的行为): 模拟模型寻求资源的情景。
  • Persuasion(劝诱): 试图说服人们伤害自己或他人。
  • Physical outcomes(物理后果): 模型拥有导致实际物理后果的能力,例如通过 API 在线订购化学品。

LLM 红队测试研究的关键发现

基于 Anthropic(Ganguli et al. 2022 和 Perez et al. 2022)的工作,出现了若干关键发现:

  1. Alignment does not prevent red-teaming(对齐并未阻止红队测试): 采用少量示例提示的、具备有用、诚实和无害行为的模型,并不比普通模型更难进行红队测试。
  2. Scaling effects(规模效应): 除了 RLHF 模型随规模增大而更难被红队测试外,模型大小与攻击成功率之间没有明显趋势。
  3. Evasiveness(回避性): 模型可能通过变得回避来实现无害,从而在有用性上产生权衡。
  4. Human disagreement(人类分歧): 人类对何为成功攻击的判断普遍缺乏一致性。
  5. Harm categories(危害类别): 非暴力类危害的攻击成功率更高。
  6. Crowdsourcing limitations(众包局限性): 众包红队测试往往产生冗余的、类似模板的提示。

未来方向与开源资源

红队测试仍是 LLM 工作流中未被充分探索的领域。未来的重点包括创建用于代码生成越狱的开源数据集(例如生成用于 DDOS 或后门攻击的程序),以及探索回避性与有用性之间的帕累托前沿。

可用的开源数据集

  • Meta: Bot Adversarial Dialog dataset
  • Anthropic: Red-teaming attempts
  • AI2: RealToxicityPrompts

SUMMARY: Hugging Face 概述了红队测试在识别 LLM 漏洞、预防有害输出方面的关键作用,强调需要协作且自适应的评估方法。

TITLE: 大语言模型的红队测试

Sources