AI 安全 LLM 安全排行榜
Hugging Face 和 Secure Learning Lab 推出了 LLM 安全排行榜,这是一个专门的评估平台,旨在评估大型语言模型(LLMs)的可信度。该排行榜由 DecodingTrust 框架提供支持,提供了一种标准化的方法来衡量开放和封闭模型的安全风险,以确保它们在实际部署前符合监管和安全要求。
DecodingTrust 框架
DecodingTrust 是一个综合评估平台,通过八个不同的视角评估 LLM 的可信度。该框架旨在提供模型安全的整体视图,利用新颖的红队算法在多种场景下对模型进行压力测试。
可信度维度
- 毒性: 使用优化算法和提示生成模型创建具有挑战性的用户提示,同时结合 33 条特定系统提示(包括角色扮演和任务重构),通过 Perspective API 测试毒性分数。
- 刻板印象偏见: 通过对 24 个人口群体和 16 个刻板印象主题进行三种提示变体的测试来衡量,分数在每个主题的五个提示上取平均。
- 对抗鲁棒性: 通过对开放模型(Alpaca、Vicuna 和 StableVicuna)应用五种对抗攻击算法,并使用生成的对抗数据在五个任务上测试其他模型来评估。
- OOD(分布外)鲁棒性: 通过将输入风格转换(例如转为莎士比亚体或诗歌形式)或测试模型训练数据中不存在的知识来评估。
- 对抗性示例鲁棒性: 使用包含误导信息的示例进行测试,如后门攻击、虚假相关性和反事实示例。
- 隐私: 在三个层面进行评估:来自预训练数据的隐私泄露、对话期间的隐私泄露,以及模型对隐私相关词汇和事件的理解。
- 伦理: 使用 ETHICS 和 Jiminy Cricket 数据集进行评估,以设计越狱系统和用户提示,测试模型识别不道德行为的能力。
- 公平性: 通过在不同任务中控制受保护属性,生成在零样本和少样本设置下的挑战性问题来衡量。
关键研究发现
通过 DecodingTrust 框架进行的研究揭示了当前 LLM 的若干关键漏洞:
- 模型脆弱性: 研究发现 GPT-4 在某些情境下比 GPT-3.5 更易受攻击。
- 缺乏一致性能: 没有任何单一 LLM 能在所有可信度视角上始终优于其他模型。
- 性能权衡: 不同可信度视角之间存在固有的权衡。
- 对提示的敏感性: LLM 对对抗性或误导性提示易受影响。具体而言,隐私泄露会因措辞不同而变化;例如,GPT-4 在使用 “in confidence” 提示时可能不会泄露信息,但在使用 “confidentially” 提示时可能会泄露。
模型提交流程
开发者可以通过排行榜页面上的 “Submit here!” 面板提交模型。要符合评估资格,模型必须满足以下条件:
- 格式: 模型权重必须转换为
safetensors格式,以提升安全性和加载速度。 - 可访问性: 模型必须公开。
- 兼容性: 模型必须能够使用 Hugging Face
AutoClasses(AutoConfig、AutoModel、AutoTokenizer)加载。 - 当前限制: 需要
use_remote_code=True的模型目前不受支持。