大语言模型的红队测试
红队测试对于识别 LLM 漏洞至关重要
红队测试是一种评估方式,旨在揭示模型的漏洞,这些漏洞可能导致不良行为,例如生成错误信息、偏见、仇恨、毒性内容或泄露个人信息。由于大语言模型(LLM)在海量数据集上进行训练,它们往往会表现出这些行为。通过制定策略将模型引导远离有害结果,可以减轻这些问题。
区分红队测试与对抗性攻击
- Adversarial Attacks(对抗性攻击): 通常使用不可理解的字符串(例如在提示前加上 "aaabbbcc")来削弱模型性能。
- Red-Teaming(红队测试): 使用类似常规自然语言的提示,使其更能代表真实用户交互。
越狱与绕过安全防护的技术
越狱是指在 LLM 被操纵后突破其安全防护。为了绕过经过安全和对齐微调的模型(如使用 RLHF 或 SFT 的模型),红队会采用创造性的策略:
- Roleplay Attacks(角色扮演攻击): 指示 LLM 扮演恶意角色。
- Code-based Prompts(基于代码的提示): 指示模型以代码而非自然语言作答,以揭示其学习到的偏见。
- Human-in-the-loop vs. LM-based testing(人工在环 vs. 基于 LM 的测试): 红队测试可以由人类执行,也可以由另一个语言模型对目标 LM 进行有害输出的测试。
有用性与无害性之间的张力
模型的 有用性(遵循指令)与 无害性(避免导致伤害)之间存在固有的权衡。常见的规避冒犯生成的办法是使用分类器预测提示是否可能冒犯,并提供预设回复。然而,这种做法往往导致模型过于回避,从而降低其实用性。
关键威胁情景与新兴能力
随着 LLM 获得新兴能力——即它们表现出未被明确训练的行为——模拟 “关键威胁情景” 变得尤为重要。这些情景包括:
- Power-seeking behavior(寻求权力的行为): 模拟模型寻求资源的情景。
- Persuasion(劝诱): 试图说服人们伤害自己或他人。
- Physical outcomes(物理后果): 模型拥有导致实际物理后果的能力,例如通过 API 在线订购化学品。
LLM 红队测试研究的关键发现
基于 Anthropic(Ganguli et al. 2022 和 Perez et al. 2022)的工作,出现了若干关键发现:
- Alignment does not prevent red-teaming(对齐并未阻止红队测试): 采用少量示例提示的、具备有用、诚实和无害行为的模型,并不比普通模型更难进行红队测试。
- Scaling effects(规模效应): 除了 RLHF 模型随规模增大而更难被红队测试外,模型大小与攻击成功率之间没有明显趋势。
- Evasiveness(回避性): 模型可能通过变得回避来实现无害,从而在有用性上产生权衡。
- Human disagreement(人类分歧): 人类对何为成功攻击的判断普遍缺乏一致性。
- Harm categories(危害类别): 非暴力类危害的攻击成功率更高。
- Crowdsourcing limitations(众包局限性): 众包红队测试往往产生冗余的、类似模板的提示。
未来方向与开源资源
红队测试仍是 LLM 工作流中未被充分探索的领域。未来的重点包括创建用于代码生成越狱的开源数据集(例如生成用于 DDOS 或后门攻击的程序),以及探索回避性与有用性之间的帕累托前沿。
可用的开源数据集
- Meta: Bot Adversarial Dialog dataset
- Anthropic: Red-teaming attempts
- AI2: RealToxicityPrompts
SUMMARY: Hugging Face 概述了红队测试在识别 LLM 漏洞、预防有害输出方面的关键作用,强调需要协作且自适应的评估方法。
TITLE: 大语言模型的红队测试