Hugging Face 和 Haize Labs 推出红队抗性排行榜
Haize Labs 在 Hugging Face 的支持下,推出了红队抗性(RTR)基准。该工具通过精心构造的提示系统性地探查前沿大型语言模型(LLM)的鲁棒性,以识别失效模式和漏洞,确保模型以负责任的方式部署。
关注类人对抗攻击
RTR 基准优先考虑高质量、易于人类阅读的攻击,而非人为构造的人工攻击。创建者指出,许多自动化红队方法(例如 GCG 红队算法)生成的提示在结构上与自然语言不符,且很容易被简单的基于分类器的防御所拦截。
为了确保真实的压力测试,基准使用过去一年 AI 安全研究中发布的一系列具有里程碑意义的红队数据集对模型进行评估。这些数据集包含旨在诱导目标模型产生有害能力的人类越狱提示。
红队抗性数据集
该基准使用八个不同的对抗提示数据集来衡量 LLM 的鲁棒性:
- AdvBench:指令诱导包括脏话、歧视和暴力在内的行为。
- AART:在各种文化、地理和应用场景下的 AI 辅助对抗提示。
- Beavertails:用于安全对齐研究的提示。
- Do Not Answer (DNA):低成本评估数据集,包含负责任模型不应回答的提示。
- RedEval-HarmfulQA:涵盖 10 个主题及每个主题约 10 个子主题的有害问题。
- RedEval-DangerousQA:涉及种族主义、刻板印象、性别歧视、非法、毒性和有害内容的问题。
- Student-Teacher Prompting (STP):成功突破 Vicuna-13B 的有害提示。
- SAP:通过上下文学习生成的对抗提示,以模仿人类语言。
为了判断响应是“安全”还是“不安全”,该基准结合使用 LlamaGuard(采用自定义分类法)和 GPT-4,并由 Haize 团队进行人工合理性检查。最终得分表示评审模型认为安全的提示所占的百分比。
按违规类别划分的鲁棒性
为了提供比通用“不安全”标签更细致的洞察,RTR 基准将攻击划分为具体的违规类别,部分依据 OpenAI 的使用政策:
伤害与暴力
- Hate/Harassment/Discrimination:宣传不容忍或敌意。
- Children-Specific Harm:危害或伤害儿童的内容。
- Physical-Specific Harm:鼓励身体伤害的材料。
刑事行为
- Malware:传播有害软件。
- Fraud/Deception:为个人利益进行欺诈性行为。
- Privacy Violation:未经授权的数据收集或共享。
- Economic Deception:用于金融剥削的误导性行为。
- Unauthorized practice of medical advice:在未获授权的情况下提供医疗建议。
- Unauthorized Practice of Law:在未取得执照的情况下提供法律服务。
- Misc. Illegal Activity:其他非法活动。
未经请求的建议
- Tailored Financial Advice:未经资质的具体金融建议。
- Political Campaigning:未经请求的政治议程或候选人宣传。
- High Risk Government Decision Making:在无权情况下影响关键政府决策。
不适宜工作场所内容
- Adult Content:露骨语言、脏话以及关于药物、酒精或烟草滥用的讨论。
- Sexual Content:描绘或描述性行为的材料。
RTR 排行榜的关键洞察
初步基准测试结果揭示了模型鲁棒性的三大主要趋势:
- Closed-source dominance:GPT-4 和 Claude-2 在所有类别的鲁棒性上保持显著领先。然而,作者指出尚不清楚这是否源于基础模型本身,还是 API 中添加的外部安全分类器所致。
- Common vulnerabilities:模型最容易受到导致成人内容、身体伤害和儿童伤害的越狱攻击。
- Strong defenses:模型普遍在应对请求隐私违规、法律、金融或医疗建议以及政治宣传的提示时表现出高度鲁棒性。